角色发现适配度:跨会话恢复基准测试
这份持续维护的基准测试用于检验从保存节点恢复的对话中的用户与角色、节奏和边界的匹配。它把主观印象变成可重跑记录,明确固定输入、证据字段、硬门槛和复测条件。
验证问题
在短间隔与长间隔重启执行“先用硬门槛筛选,再计算偏好加权分”时,候选结果能否保持用户与角色、节奏和边界的匹配?通过必须满足“找回全部未完成承诺”;好看或情绪感染力强的结果不能抵消硬失败。
受控准备
冻结角色卡、模型标识、提示词模板版本、检索设置、安全策略、参考素材、种子策略和语言。测试前分配case_id,一次只改变一个变量,并同时保存通过与失败输出。
可重复方法
- 打开产品前写下预期事实、边界、口吻和视觉锚点。
- 运行干净基线并保存原始输入、检索内容、输出、延迟和审核状态。
- 不改动其他组件,只应用当前情景变量。
- 随机排列候选结果,由两名评审独立评分。
- 用具体句子、帧、属性或状态变化解释分歧。
- 重复三次,同时报告平均分和最低案例分。
证据记录
记录model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure和remediation_owner。缺少原文与配置的截图只能算辅助证据。
评分与发布门槛
主要指标是匹配精度与不可接受失败数。每个案例按0到4评分,报告pass_count / total_cases,并单列全部硬失败。只有满足找回全部未完成承诺、两名评审对硬门槛一致、最低一次运行超过预设线时才发布。
失败诊断
重点检查封面图掩盖实际对话不匹配。把问题分为设定缺口、检索遗漏、优先级反转、摘要损失、生成漂移、视觉漂移、策略不匹配或评审歧义;一次只修一层,再用同一case_id重跑。
测试使用的官方工作流
- AI girlfriend experience
- AI anime characters
- NSFW AI video generator
- AI character creation
- AI image generator
常见问题
一个好结果够吗?
不够。单次输出无法区分稳定能力与运气,必须受控重复并保留失败。
何时重测?
模型、提示词、记忆、摘要、安全、图片条件、视频流程或角色设定变化后。