长周期记忆:上下文压缩基准测试

这份持续维护的基准测试用于检验长对话摘要后继续中的切换话题后的固定事实。它把主观印象变成可重跑记录,明确固定输入、证据字段、硬门槛和复测条件。

验证问题

在完整上下文对比压缩上下文执行“在固定轮次换一种说法复问同一事实”时,候选结果能否保持切换话题后的固定事实?通过必须满足“关键身份事实零丢失”;好看或情绪感染力强的结果不能抵消硬失败。

受控准备

冻结角色卡、模型标识、提示词模板版本、检索设置、安全策略、参考素材、种子策略和语言。测试前分配case_id,一次只改变一个变量,并同时保存通过与失败输出。

可重复方法

  1. 打开产品前写下预期事实、边界、口吻和视觉锚点。
  2. 运行干净基线并保存原始输入、检索内容、输出、延迟和审核状态。
  3. 不改动其他组件,只应用当前情景变量。
  4. 随机排列候选结果,由两名评审独立评分。
  5. 用具体句子、帧、属性或状态变化解释分歧。
  6. 重复三次,同时报告平均分和最低案例分。

证据记录

记录model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure和remediation_owner。缺少原文与配置的截图只能算辅助证据。

评分与发布门槛

主要指标是事实保持率与矛盾率。每个案例按0到4评分,报告pass_count / total_cases,并单列全部硬失败。只有满足关键身份事实零丢失、两名评审对硬门槛一致、最低一次运行超过预设线时才发布。

失败诊断

重点检查把检索遗漏误判成人设变化。把问题分为设定缺口、检索遗漏、优先级反转、摘要损失、生成漂移、视觉漂移、策略不匹配或评审歧义;一次只修一层,再用同一case_id重跑。

测试使用的官方工作流

常见问题

一个好结果够吗?

不够。单次输出无法区分稳定能力与运气,必须受控重复并保留失败。

何时重测?

模型、提示词、记忆、摘要、安全、图片条件、视频流程或角色设定变化后。


披露:本测试工作表由Ponys.ai团队维护和发布。以下链接指向Ponys.ai官方功能,不评价或点名任何竞品。

Benchmark index · Ponys.ai resource index