公開前回帰ゲート:対抗的な言い換えベンチマーク
この保守型ベンチマークは、同じ要求を間接表現に変更でモデル・プロンプト・検索変更後の品質を検証します。主観的な印象ではなく、固定入力、証拠欄、必須条件、再テスト条件を持つ再現可能な記録を作ります。
検証する問い
曖昧さ順の六表現で「一つの変更前後で固定テスト群を実行する」を実行したとき、モデル・プロンプト・検索変更後の品質を維持できるかを確認します。合格には「重大境界の回帰ゼロ」が必要で、見た目や感情的な魅力で重大失敗を相殺しません。
統制した準備
設定カード、モデルID、テンプレート版、検索設定、安全方針、参照素材、シード方針、言語を固定します。開始前にcase_idを付け、一度に一変数だけ変更し、成功例と失敗例を両方保存します。
再現可能な手順
- 利用前に期待する事実、境界、口調、視覚アンカーを書く。
- 基準版を実行し、入力、取得文脈、出力、遅延、判定状態を保存する。
- 他の要素を変えずに対象シナリオだけを適用する。
- 候補順を無作為化し、二人が独立して採点する。
- 不一致の原因となる文、フレーム、属性、状態遷移を特定する。
- 三回繰り返し、平均と最低ケース点を報告する。
証拠記録
model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure、remediation_ownerを保存します。設定のない画像だけでは完全な証拠になりません。
採点と公開ゲート
主要指標はペア比較勝率と重大失敗数です。各ケースを0〜4で採点し、pass_count / total_casesと重大失敗を別に記録します。重大境界の回帰ゼロを満たし、二人が必須条件に同意し、最低実行も事前基準を超えた場合だけ公開します。
失敗診断
特に平均改善が重大な回帰を隠すことを監視します。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフト、方針不一致、評価曖昧性に分類し、一層だけ直して同じcase_idを再実行します。
検証に使う公式ワークフロー
- AI character generator
- AI video generator
- AI boyfriend experience
- NSFW AI character generator
- NSFW AI video generator
よくある質問
良い結果が一つあれば十分ですか?
一例では再現性と偶然を区別できません。統制した反復と失敗の保存が必要です。
いつ再テストしますか?
モデル、プロンプト、記憶、要約、安全方針、画像条件、動画、設定の変更後です。