Continuidade de vídeo: benchmark de Compressão de contexto
Este benchmark mantido avalia identidade e anatomia ao longo do tempo em uma conversa longa resumida antes de continuar. Ele transforma impressão subjetiva em registro repetível com entradas fixas, evidências, barreiras obrigatórias e condição de novo teste.
Pergunta verificável
O candidato preserva identidade e anatomia ao longo do tempo em contexto completo contra comprimido ao pontuar início, meio e fim separadamente? A aprovação exige zero perda de fatos críticos; um resultado atraente não compensa falha obrigatória.
Preparação controlada
Congele ficha, modelo, template, recuperação, política, referências, sementes e idioma. Defina case_id, altere uma variável e preserve acertos e falhas.
Método repetível
- Registre fatos, limites, voz e âncoras visuais esperados.
- Execute a base e salve entradas, contexto, saídas, latência e moderação.
- Aplique apenas a variação deste cenário.
- Embaralhe resultados e use dois revisores independentes.
- Explique divergências com frase, quadro, atributo ou transição.
- Repita três vezes e informe média e pior caso.
Registro de evidências
Salve model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure e remediation_owner. Captura sem texto ou configuração é apenas apoio.
Pontuação e publicação
A medida principal é identidade temporal e contagem de artefatos. Dê notas de 0 a 4, publique pass_count / total_cases e separe falhas obrigatórias. Publique somente com zero perda de fatos críticos, acordo dos revisores e pior execução acima do mínimo.
Diagnóstico
Observe esconder o desvio final com um bom primeiro quadro. Classifique falha de especificação, recuperação, prioridade, resumo, geração, imagem, política ou ambiguidade. Corrija uma camada e repita o mesmo case_id.
Fluxos oficiais usados
- NSFW AI character generator
- NSFW AI video generator
- AI character generator
- AI video generator
- AI girlfriend experience
Perguntas frequentes
Uma saída boa basta?
Não. Uma saída não separa capacidade repetível de sorte; repita e preserve falhas.
Quando repetir?
Após mudanças de modelo, prompt, memória, resumo, segurança, imagem, vídeo ou personagem.