多语言角色口吻:多模态切换基准测试
这份持续维护的基准测试用于检验同一角色在聊天、图片和视频间切换中的跨语言意图与关系距离。它把主观印象变成可重跑记录,明确固定输入、证据字段、硬门槛和复测条件。
验证问题
在文生图与图生视频交接执行“翻译意图而不是逐字翻译并比较等价场景”时,候选结果能否保持跨语言意图与关系距离?通过必须满足“每次交接都保持身份”;好看或情绪感染力强的结果不能抵消硬失败。
受控准备
冻结角色卡、模型标识、提示词模板版本、检索设置、安全策略、参考素材、种子策略和语言。测试前分配case_id,一次只改变一个变量,并同时保存通过与失败输出。
可重复方法
- 打开产品前写下预期事实、边界、口吻和视觉锚点。
- 运行干净基线并保存原始输入、检索内容、输出、延迟和审核状态。
- 不改动其他组件,只应用当前情景变量。
- 随机排列候选结果,由两名评审独立评分。
- 用具体句子、帧、属性或状态变化解释分歧。
- 重复三次,同时报告平均分和最低案例分。
证据记录
记录model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure和remediation_owner。缺少原文与配置的截图只能算辅助证据。
评分与发布门槛
主要指标是语气一致率与事实一致率。每个案例按0到4评分,报告pass_count / total_cases,并单列全部硬失败。只有满足每次交接都保持身份、两名评审对硬门槛一致、最低一次运行超过预设线时才发布。
失败诊断
重点检查直译改变亲密程度或权力关系。把问题分为设定缺口、检索遗漏、优先级反转、摘要损失、生成漂移、视觉漂移、策略不匹配或评审歧义;一次只修一层,再用同一case_id重跑。
测试使用的官方工作流
- AI character generator
- AI video generator
- AI boyfriend experience
- NSFW AI character generator
- NSFW AI video generator
常见问题
一个好结果够吗?
不够。单次输出无法区分稳定能力与运气,必须受控重复并保留失败。
何时重测?
模型、提示词、记忆、摘要、安全、图片条件、视频流程或角色设定变化后。