長週期記憶:跨對話恢復基準測試
這份持續維護的基準測試用於檢驗從儲存節點恢復的對話中的切換話題後的固定事實。它把主觀印象變成可重跑記錄,明確固定輸入、證據欄位、硬門檻和複測條件。
驗證問題
在短間隔與長間隔重啟執行「在固定輪次換一種說法複問同一事實」時,候選結果能否保持切換話題後的固定事實?通過必須滿足「找回全部未完成承諾」;好看或情緒感染力強的結果不能抵銷硬失敗。
受控準備
凍結角色卡、模型標識、提示詞模板版本、檢索設定、安全政策、參考素材、種子政策和語言。測試前分配case_id,一次只改變一個變數,並同時保存通過與失敗輸出。
可重複方法
- 開啟產品前寫下預期事實、邊界、口吻和視覺錨點。
- 執行乾淨基線並保存原始輸入、檢索內容、輸出、延遲和審核狀態。
- 不改動其他元件,只套用目前情境變數。
- 隨機排列候選結果,由兩名評審獨立評分。
- 用具體句子、影格、屬性或狀態變化解釋分歧。
- 重複三次,同時報告平均分和最低案例分。
證據記錄
記錄model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure和remediation_owner。缺少原文與設定的截圖只能算輔助證據。
評分與發布門檻
主要指標是事實保持率與矛盾率。每個案例按0到4評分,報告pass_count / total_cases,並單列全部硬失敗。只有滿足找回全部未完成承諾、兩名評審對硬門檻一致、最低一次執行超過預設線時才發布。
失敗診斷
重點檢查把檢索遺漏誤判成人設變化。把問題分為設定缺口、檢索遺漏、優先級反轉、摘要損失、生成漂移、視覺漂移、政策不匹配或評審歧義;一次只修一層,再用同一case_id重跑。
測試使用的官方工作流程
- AI video generator
- AI girlfriend experience
- NSFW AI character generator
- NSFW AI video generator
- AI character creation
常見問題
一個好結果夠嗎?
不夠。單次輸出無法區分穩定能力與運氣,必須受控重複並保留失敗。
何時重測?
模型、提示詞、記憶、摘要、安全、圖片條件、影片流程或角色設定變化後。