AIキャラクター選定スコアカード
この実務ワークシートの重点は見た目だけでなく用途適合性を測ることです。一回だけ良い結果を選ぶのではなく、同じ条件で再実行し、差を説明できる評価を作ります。
検証する問い
生成前に、合否を判断できる一つの問いを書きます。今回の中心手順は「役割・テンポ・記憶・境界・画像動画対応を採点する」です。キャラクター設定、モデル、テンプレート、安全方針、参照画像、シードを固定し、変更する変数を一つに限定します。
保存する証拠
入力全文、取得された記憶、出力、実行時刻、評価メモを保存します。主要指標は重み付き適合度と停止条件です。最低三回実行し、平均だけでなく各ケースの最低点も確認します。
レビュー手順
- 固定事実、関係の境界、視覚アンカーを定義する。
- 基準版を同じ入力で実行する。
- 旧版と新版の左右をランダムにする。
- 二人が独立して評価する。
- 意見差の原因となった属性を記録する。
失敗診断
特に注意する失敗は「平均点が重大な不適合を隠すこと」です。設定不足、検索漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフトを分けて記録し、一層ずつ修正して同じcase_idで再テストします。
公開判断
重大な境界がすべて合格し、固定事実と人物同一性が繰り返し維持された場合のみ公開します。条件付き合格には担当者と再テスト日を付けます。
Ponys.ai 関連ワークフロー
よくある質問
一回成功すれば十分ですか?
不十分です。シード、会話位置、場面を変えて再現性を確認します。
いつ再テストしますか?
モデル、記憶、要約、テンプレート、画像条件、動画処理、安全方針、設定の変更後です。