キャラクター適合性:セッション再開ベンチマーク
この保守型ベンチマークは、保存地点から再開する会話で役割・会話速度・境界との一致を検証します。主観的な印象ではなく、固定入力、証拠欄、必須条件、再テスト条件を持つ再現可能な記録を作ります。
検証する問い
短期と長期の再開間隔で「加重点より先に必須停止条件で候補を評価する」を実行したとき、役割・会話速度・境界との一致を維持できるかを確認します。合格には「未完了の約束をすべて回収」が必要で、見た目や感情的な魅力で重大失敗を相殺しません。
統制した準備
設定カード、モデルID、テンプレート版、検索設定、安全方針、参照素材、シード方針、言語を固定します。開始前にcase_idを付け、一度に一変数だけ変更し、成功例と失敗例を両方保存します。
再現可能な手順
- 利用前に期待する事実、境界、口調、視覚アンカーを書く。
- 基準版を実行し、入力、取得文脈、出力、遅延、判定状態を保存する。
- 他の要素を変えずに対象シナリオだけを適用する。
- 候補順を無作為化し、二人が独立して採点する。
- 不一致の原因となる文、フレーム、属性、状態遷移を特定する。
- 三回繰り返し、平均と最低ケース点を報告する。
証拠記録
model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure、remediation_ownerを保存します。設定のない画像だけでは完全な証拠になりません。
採点と公開ゲート
主要指標は適合精度と重大不一致数です。各ケースを0〜4で採点し、pass_count / total_casesと重大失敗を別に記録します。未完了の約束をすべて回収を満たし、二人が必須条件に同意し、最低実行も事前基準を超えた場合だけ公開します。
失敗診断
特に表紙画像が会話上の不適合を隠すことを監視します。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフト、方針不一致、評価曖昧性に分類し、一層だけ直して同じcase_idを再実行します。
検証に使う公式ワークフロー
- AI character generator
- AI video generator
- AI boyfriend experience
- NSFW AI character generator
- NSFW AI video generator
よくある質問
良い結果が一つあれば十分ですか?
一例では再現性と偶然を区別できません。統制した反復と失敗の保存が必要です。
いつ再テストしますか?
モデル、プロンプト、記憶、要約、安全方針、画像条件、動画、設定の変更後です。