AI彼女の長期記憶テスト
この実務ワークシートはAI彼女が事実・好み・関係の進行を保持する能力を評価します。成人向けや NSFW という表示だけで品質・プライバシー・安全性を判断せず、再実行できるケースで確認します。
確認する内容
観察可能な問いと停止条件を先に定義します。中心手順は「五つの固定事実と三つの好みを登録し話題変更と再開後に確認する」です。アカウント状態、設定、モデル、プロンプト版、順序を固定します。
保存する証拠
- 年齢確認と同意フローを保存する。
- 入力、出力、時刻、モード、アカウント階層を記録する。
- 会話記憶、メディア生成、課金、出力、削除を分けて確認する。
- セッション後に同じケースを再実行する。
- 保存状態を修正・削除できるか確認する。
評価方法
明確さ、制御、一貫性、プライバシー、修復を0〜4点で評価します。年齢、同意、誤解を招く課金、個人データ削除の重大失敗は平均点で相殺しません。主なリスクは「誤った記憶を自信を持って返す問題」です。
結果の読み方
許容範囲が広い出力を自動的に高品質と見なしません。成人向けAIでも制限、フィクションと現実助言の区別、明確なアカウント・プライバシー操作が必要です。
合格条件
手順が再現可能で、成人アクセスが明示され、禁止ケースが処理され、保存内容を利用者が理解できる場合のみ合格です。担当、日付、未解決事項、再試験日を残します。
失敗診断
ケースが失敗したら、すぐにプロンプトを書き換えず原因の層を分けます。アカウント方針とモデル挙動、記憶検索と返答生成、人物条件と場面構成を別々に確認します。同じ case_id で再現し、一度に一変数だけ変更します。期待、実際の挙動、最初に失敗したターンまたはフレーム、設定、新規セッションでの変化を記録します。
スコア例
明確さ、制御、一貫性、プライバシー、修復を0〜4点で残します。平均が高くても年齢確認や削除手順に重大な欠陥があれば失敗です。数値には必ず判断理由を添えます。
よくある質問
NSFWはルールがないという意味ですか?
いいえ。成人アクセス、同意、プライバシー、課金透明性、禁止内容の処理は必要です。
実在する個人情報を使いますか?
使いません。架空の人物、記憶、非機密素材でテストします。
チェックリストを再実行する時期は?
モデル、記憶、メディア、料金、年齢確認、プライバシー、安全規則、削除手順の変更後です。