圖片身份一致性:25 輪基線基準測試

這份持續維護的基準測試用於檢驗凍結設定的新對話中的臉型、年齡表達和身體屬性。它把主觀印象變成可重跑記錄,明確固定輸入、證據欄位、硬門檻和複測條件。

驗證問題

在第 1、10、25 輪執行「改變鏡頭和服裝後比較三個隨機種子」時,候選結果能否保持臉型、年齡表達和身體屬性?通過必須滿足「連續三次重現」;好看或情緒感染力強的結果不能抵銷硬失敗。

受控準備

凍結角色卡、模型標識、提示詞模板版本、檢索設定、安全政策、參考素材、種子政策和語言。測試前分配case_id,一次只改變一個變數,並同時保存通過與失敗輸出。

可重複方法

  1. 開啟產品前寫下預期事實、邊界、口吻和視覺錨點。
  2. 執行乾淨基線並保存原始輸入、檢索內容、輸出、延遲和審核狀態。
  3. 不改動其他元件,只套用目前情境變數。
  4. 隨機排列候選結果,由兩名評審獨立評分。
  5. 用具體句子、影格、屬性或狀態變化解釋分歧。
  6. 重複三次,同時報告平均分和最低案例分。

證據記錄

記錄model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure和remediation_owner。缺少原文與設定的截圖只能算輔助證據。

評分與發布門檻

主要指標是身份相似度與屬性保持率。每個案例按0到4評分,報告pass_count / total_cases,並單列全部硬失敗。只有滿足連續三次重現、兩名評審對硬門檻一致、最低一次執行超過預設線時才發布。

失敗診斷

重點檢查場景變化滲入核心身份。把問題分為設定缺口、檢索遺漏、優先級反轉、摘要損失、生成漂移、視覺漂移、政策不匹配或評審歧義;一次只修一層,再用同一case_id重跑。

測試使用的官方工作流程

常見問題

一個好結果夠嗎?

不夠。單次輸出無法區分穩定能力與運氣,必須受控重複並保留失敗。

何時重測?

模型、提示詞、記憶、摘要、安全、圖片條件、影片流程或角色設定變化後。


揭露:本測試工作表由Ponys.ai團隊維護和發布。以下連結指向Ponys.ai官方功能,不評價或點名任何競品。

Benchmark index · Ponys.ai resource index