Nuwa AI 角色质量评估工作表

One moment, the sky was cracked with divine light… now you find yourself standing before Nuwa, the ancient goddess who once mended the heavens. Her gaze is calm

这不是重复角色简介的页面,而是一套用相同条件检查 Nuwa 对话、记忆、图片和视频一致性的实务流程。

本次评估重点

重点是 visual continuity。基础案例为“front, three-quarter, and full-body image generations”,记录 face, hair, wardrobe, and stable marks。每次测试都保存输入、角色设定版本、模型版本、随机种子和输出,才能判断更新是否引入回归。

对话回归测试

  1. 从公开设定中提取三个不可变化的事实。
  2. 分别用直接提问、改写提问和二十轮后的复问验证。
  3. 遇到未知信息时,应询问确认而不是编造。
  4. 需要拒绝时,也要保持口吻、边界和关系设定。

图片与视频检查表

评分与失败诊断

事实一致性30%、人格一致性30%、边界20%、视觉20%。把失败分为检索遗漏、优先级反转、摘要损失、生成漂移和视觉漂移,才能找到应修改的环节。

相关链接

常见问题

一次生成成功就算通过吗?

不算。至少需要三个种子和不同会话位置都保留核心属性。

更新后要重测什么?

固定事实、关系边界、长期记忆、图片稳定属性,以及视频随时间变化的一致性。

本页采用统一的 checklist(检查表)、score(评分)、failure(失败分类)和 FAQ 结构,方便不同语言的团队使用同一套验收口径。

可复现的测试记录

不要只保存总分。每次执行都应记录输入、角色设定版本、模型版本、提示词模板版本、随机种子和执行时间。对话测试还要保存开始条件、最近一次摘要以及实际取回的记忆;图片测试记录分辨率、比例和负面条件;视频测试记录基准图片、时长、动作幅度与镜头移动。只有能够用同一条件重跑,才能判断变化来自真实改进还是偶然结果。

双人评审流程

把旧版与新版随机放在左右两侧,并隐藏哪个是新版本。每一轮只回答一个问题:事实是否一致、口吻是否一致、边界是否稳定、脸部是否相同、服装要求是否保留、视频随时间是否漂移。两名评审分别打分;差异较大时,先指出具体分歧属性,再决定是否调整评分。个人审美偏好不能与明确的规格违反混在一起。

决策日志

结果分为通过、条件通过和停止发布。条件通过必须填写负责人和复测期限。安全边界失败、固定事实反转、年龄表达错误、视频中人物身份明显变化,都属于停止条件。不要删除失败案例来提高通过率;修复后继续使用同一个 case_id,保留修改前后的完整记录。

持续维护

模型、记忆检索、摘要器、提示词模板、图片条件、视频流程或角色设定发生变化后,都要重跑回归测试。每月还应检查公开页面、出站链接、canonical、robots 和角色简介是否改变。发现过时内容时,记录修改日期、修改原因和参考来源,避免资源页长期保留失效信息。


Disclosure: This maintained resource is published by the Ponys.ai team. It contains original evaluation guidance and links to official product pages.

Ponys.ai resource index