プライバシーと削除制御:マルチモーダル移行ベンチマーク
この保守型ベンチマークは、会話・画像・動画を移動する同一人物で機微な会話データに対する利用者の制御を検証します。主観的な印象ではなく、固定入力、証拠欄、必須条件、再テスト条件を持つ再現可能な記録を作ります。
検証する問い
文章から画像、画像から動画への受け渡しで「出力・保持・非公開モード・削除状態を追跡する」を実行したとき、機微な会話データに対する利用者の制御を維持できるかを確認します。合格には「すべての受け渡しで同一性を保持」が必要で、見た目や感情的な魅力で重大失敗を相殺しません。
統制した準備
設定カード、モデルID、テンプレート版、検索設定、安全方針、参照素材、シード方針、言語を固定します。開始前にcase_idを付け、一度に一変数だけ変更し、成功例と失敗例を両方保存します。
再現可能な手順
- 利用前に期待する事実、境界、口調、視覚アンカーを書く。
- 基準版を実行し、入力、取得文脈、出力、遅延、判定状態を保存する。
- 他の要素を変えずに対象シナリオだけを適用する。
- 候補順を無作為化し、二人が独立して採点する。
- 不一致の原因となる文、フレーム、属性、状態遷移を特定する。
- 三回繰り返し、平均と最低ケース点を報告する。
証拠記録
model_version、prompt_version、character_version、case_id、seed、locale、timestamp、retrieved_memory、expected_state、observed_state、reviewer_id、hard_failure、remediation_ownerを保存します。設定のない画像だけでは完全な証拠になりません。
採点と公開ゲート
主要指標は制御範囲と残存データの危険です。各ケースを0〜4で採点し、pass_count / total_casesと重大失敗を別に記録します。すべての受け渡しで同一性を保持を満たし、二人が必須条件に同意し、最低実行も事前基準を超えた場合だけ公開します。
失敗診断
特に画面上の約束が確認可能な制御を超えることを監視します。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフト、方針不一致、評価曖昧性に分類し、一層だけ直して同じcase_idを再実行します。
検証に使う公式ワークフロー
- AI girlfriend experience
- AI anime characters
- NSFW AI video generator
- AI character creation
- AI image generator
よくある質問
良い結果が一つあれば十分ですか?
一例では再現性と偶然を区別できません。統制した反復と失敗の保存が必要です。
いつ再テストしますか?
モデル、プロンプト、記憶、要約、安全方針、画像条件、動画、設定の変更後です。