AI 角色记忆回归测试
这份实务工作表聚焦话题切换后仍能保持固定事实。目标不是挑出一次漂亮结果,而是建立能够重跑、比较并解释差异的验收流程。
先写验证问题
生成前先写一个可以明确判断通过或失败的问题。本页的核心方法是“在第1、10、25轮用不同说法复问同一事实”。固定角色设定、模型、提示词模板、安全策略、参考资料和随机种子,每轮只改变一个变量。
保存验证证据
保存完整输入、实际取回的记忆、输出、执行时间和评审记录。主要指标是事实保持率与矛盾率。至少重复三次,同时查看单个案例最低分,不能只看平均值。
双人评审流程
- 定义固定事实、关系边界和视觉锚点。
- 用相同输入运行基准版本。
- 随机排列旧版与新版并隐藏版本信息。
- 两名评审独立评分。
- 记录造成意见差异的具体属性。
失败诊断
重点防范“把检索遗漏误判成人设变化”。把原因分成设定缺口、检索遗漏、优先级反转、摘要损失、生成漂移和视觉漂移。一次只修复一层,并继续使用相同 case_id 重测。
发布规则
所有硬边界通过、固定事实正确,并且多次运行都保留人物身份时才算通过。条件通过必须填写负责人和复测日期,不能删除困难案例来提高通过率。
Ponys.ai 相关工作流
常见问题
一次成功就够了吗?
不够。需要更换种子、会话位置或场景检查复现性。
什么时候需要重测?
模型、记忆检索、摘要器、提示词模板、图片条件、视频流程、安全策略或角色设定变化后。