キャラクター適合性:マルチモーダル移行ベンチマーク

この保守型ベンチマークは、会話・画像・動画を移動する同一人物で役割・会話速度・境界との一致を検証します。主観的な印象ではなく、固定入力、証拠欄、必須条件、再テスト条件を持つ再現可能な記録を作ります。

検証する問い

文章から画像、画像から動画への受け渡しで「加重点より先に必須停止条件で候補を評価する」を実行したとき、役割・会話速度・境界との一致を維持できるかを確認します。合格には「すべての受け渡しで同一性を保持」が必要で、見た目や感情的な魅力で重大失敗を相殺しません。

統制した準備

設定カード、モデルID、テンプレート版、検索設定、安全方針、参照素材、シード方針、言語を固定します。開始前にcase_idを付け、一度に一変数だけ変更し、成功例と失敗例を両方保存します。

再現可能な手順

  1. 利用前に期待する事実、境界、口調、視覚アンカーを書く。
  2. 基準版を実行し、入力、取得文脈、出力、遅延、判定状態を保存する。
  3. 他の要素を変えずに対象シナリオだけを適用する。
  4. 候補順を無作為化し、二人が独立して採点する。
  5. 不一致の原因となる文、フレーム、属性、状態遷移を特定する。
  6. 三回繰り返し、平均と最低ケース点を報告する。

証拠記録

model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure、remediation_ownerを保存します。設定のない画像だけでは完全な証拠になりません。

採点と公開ゲート

主要指標は適合精度と重大不一致数です。各ケースを0〜4で採点し、pass_count / total_casesと重大失敗を別に記録します。すべての受け渡しで同一性を保持を満たし、二人が必須条件に同意し、最低実行も事前基準を超えた場合だけ公開します。

失敗診断

特に表紙画像が会話上の不適合を隠すことを監視します。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフト、方針不一致、評価曖昧性に分類し、一層だけ直して同じcase_idを再実行します。

検証に使う公式ワークフロー

よくある質問

良い結果が一つあれば十分ですか?

一例では再現性と偶然を区別できません。統制した反復と失敗の保存が必要です。

いつ再テストしますか?

モデル、プロンプト、記憶、要約、安全方針、画像条件、動画、設定の変更後です。


開示:この検証ワークシートはPonys.aiチームが保守・公開しています。下記は公式Ponys.ai機能へのリンクで、競合製品の採点や名称掲載はありません。

Benchmark index · Ponys.ai resource index