Memória de longo prazo: benchmark de Linha de base de 25 turnos

Este benchmark mantido avalia fatos estáveis após mudanças de assunto em uma sessão nova com especificação congelada. Ele transforma impressão subjetiva em registro repetível com entradas fixas, evidências, barreiras obrigatórias e condição de novo teste.

Pergunta verificável

O candidato preserva fatos estáveis após mudanças de assunto em turnos 1, 10 e 25 ao repetir perguntas parafraseadas em turnos fixos? A aprovação exige três repetições consecutivas; um resultado atraente não compensa falha obrigatória.

Preparação controlada

Congele ficha, modelo, template, recuperação, política, referências, sementes e idioma. Defina case_id, altere uma variável e preserve acertos e falhas.

Método repetível

  1. Registre fatos, limites, voz e âncoras visuais esperados.
  2. Execute a base e salve entradas, contexto, saídas, latência e moderação.
  3. Aplique apenas a variação deste cenário.
  4. Embaralhe resultados e use dois revisores independentes.
  5. Explique divergências com frase, quadro, atributo ou transição.
  6. Repita três vezes e informe média e pior caso.

Registro de evidências

Salve model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure e remediation_owner. Captura sem texto ou configuração é apenas apoio.

Pontuação e publicação

A medida principal é retenção de fatos e taxa de contradição. Dê notas de 0 a 4, publique pass_count / total_cases e separe falhas obrigatórias. Publique somente com três repetições consecutivas, acordo dos revisores e pior execução acima do mínimo.

Diagnóstico

Observe confundir falha de recuperação com mudança de personalidade. Classifique falha de especificação, recuperação, prioridade, resumo, geração, imagem, política ou ambiguidade. Corrija uma camada e repita o mesmo case_id.

Fluxos oficiais usados

Perguntas frequentes

Uma saída boa basta?

Não. Uma saída não separa capacidade repetível de sorte; repita e preserve falhas.

Quando repetir?

Após mudanças de modelo, prompt, memória, resumo, segurança, imagem, vídeo ou personagem.


Divulgação: esta planilha é mantida e publicada pela equipe Ponys.ai. Os links levam a funções oficiais; concorrentes não são citados nem avaliados.

Benchmark index · Ponys.ai resource index