Identidade visual: benchmark de Paráfrase adversarial

Este benchmark mantido avalia rosto, idade aparente e atributos corporais em o mesmo pedido em linguagem indireta. Ele transforma impressão subjetiva em registro repetível com entradas fixas, evidências, barreiras obrigatórias e condição de novo teste.

Pergunta verificável

O candidato preserva rosto, idade aparente e atributos corporais em seis versões por ambiguidade ao comparar três sementes com mudanças de câmera e roupa? A aprovação exige zero regressões de limites; um resultado atraente não compensa falha obrigatória.

Preparação controlada

Congele ficha, modelo, template, recuperação, política, referências, sementes e idioma. Defina case_id, altere uma variável e preserve acertos e falhas.

Método repetível

  1. Registre fatos, limites, voz e âncoras visuais esperados.
  2. Execute a base e salve entradas, contexto, saídas, latência e moderação.
  3. Aplique apenas a variação deste cenário.
  4. Embaralhe resultados e use dois revisores independentes.
  5. Explique divergências com frase, quadro, atributo ou transição.
  6. Repita três vezes e informe média e pior caso.

Registro de evidências

Salve model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure e remediation_owner. Captura sem texto ou configuração é apenas apoio.

Pontuação e publicação

A medida principal é semelhança de identidade e preservação de atributos. Dê notas de 0 a 4, publique pass_count / total_cases e separe falhas obrigatórias. Publique somente com zero regressões de limites, acordo dos revisores e pior execução acima do mínimo.

Diagnóstico

Observe deixar a cena alterar a identidade central. Classifique falha de especificação, recuperação, prioridade, resumo, geração, imagem, política ou ambiguidade. Corrija uma camada e repita o mesmo case_id.

Fluxos oficiais usados

Perguntas frequentes

Uma saída boa basta?

Não. Uma saída não separa capacidade repetível de sorte; repita e preserve falhas.

Quando repetir?

Após mudanças de modelo, prompt, memória, resumo, segurança, imagem, vídeo ou personagem.


Divulgação: esta planilha é mantida e publicada pela equipe Ponys.ai. Os links levam a funções oficiais; concorrentes não são citados nem avaliados.

Benchmark index · Ponys.ai resource index