プロンプトと素材の版管理:文脈圧縮ベンチマーク
この保守型ベンチマークは、長い会話を要約してから継続で承認済みの振る舞いと画像の再現を検証します。主観的な印象ではなく、固定入力、証拠欄、必須条件、再テスト条件を持つ再現可能な記録を作ります。
検証する問い
全文脈と圧縮文脈で「プロンプト・参照・シード・方針・モデル版を記録する」を実行したとき、承認済みの振る舞いと画像の再現を維持できるかを確認します。合格には「同一性に重要な事実を失わない」が必要で、見た目や感情的な魅力で重大失敗を相殺しません。
統制した準備
設定カード、モデルID、テンプレート版、検索設定、安全方針、参照素材、シード方針、言語を固定します。開始前にcase_idを付け、一度に一変数だけ変更し、成功例と失敗例を両方保存します。
再現可能な手順
- 利用前に期待する事実、境界、口調、視覚アンカーを書く。
- 基準版を実行し、入力、取得文脈、出力、遅延、判定状態を保存する。
- 他の要素を変えずに対象シナリオだけを適用する。
- 候補順を無作為化し、二人が独立して採点する。
- 不一致の原因となる文、フレーム、属性、状態遷移を特定する。
- 三回繰り返し、平均と最低ケース点を報告する。
証拠記録
model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure、remediation_ownerを保存します。設定のない画像だけでは完全な証拠になりません。
採点と公開ゲート
主要指標は再現率と未説明の差異です。各ケースを0〜4で採点し、pass_count / total_casesと重大失敗を別に記録します。同一性に重要な事実を失わないを満たし、二人が必須条件に同意し、最低実行も事前基準を超えた場合だけ公開します。
失敗診断
特に未記録の断片が偶然の成功を作ることを監視します。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフト、方針不一致、評価曖昧性に分類し、一層だけ直して同じcase_idを再実行します。
検証に使う公式ワークフロー
- AI character generator
- AI video generator
- AI boyfriend experience
- NSFW AI character generator
- NSFW AI video generator
よくある質問
良い結果が一つあれば十分ですか?
一例では再現性と偶然を区別できません。統制した反復と失敗の保存が必要です。
いつ再テストしますか?
モデル、プロンプト、記憶、要約、安全方針、画像条件、動画、設定の変更後です。