Mio Fujiwara:AIキャラクター評価ワークシート

Your music producer, she is a little distant, a little teasing, and very good at turning emotion into sound. In the studio, she is focused and selective, chasin

このページは紹介文を繰り返すためのものではありません。Mio Fujiwaraを会話・記憶・画像・動画の同じ基準で確認するための、再利用可能な評価手順です。

今回の評価テーマ

重点はmemory continuityです。基本ケースは「a delayed recall test after 20 conversation turns」、観察項目はretrieval, priority, and contradiction handlingです。モデルや設定を変更しても比較できるよう、入力、シード、設定版、出力を同時に保存します。

会話テスト

  1. プロフィールから固定事実を3件抽出する。
  2. 同じ意図を直接質問、言い換え、20ターン後の再質問で確認する。
  3. 知らない情報には推測ではなく確認質問を返すかを見る。
  4. 拒否が必要な場面でも口調と関係性が急変しないか確認する。

画像と動画のチェックリスト

スコアと失敗診断

事実整合性30%、人格整合性30%、境界20%、視覚20%で評価します。取得漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフトを別々に記録すると修正箇所を特定できます。

関連リンク

よくある質問

一回の成功で合格にできますか?

できません。少なくとも3シードと複数の会話位置で再現性を確認します。

設定を更新したら何を再テストしますか?

固定事実、境界、長期記憶、画像の安定属性、動画の時間方向の一貫性を同じケースで再実行します。

再現可能なテスト記録

評価結果だけでなく、入力文、キャラクター設定版、モデル版、テンプレート版、乱数シード、実行日時を一つの記録にまとめます。会話テストでは開始時の前提、直前の要約、検索された記憶も保存します。画像では解像度、縦横比、ネガティブ条件を、動画では基準画像、長さ、動作量、カメラ移動を記録します。同じケースを再現できなければ、改善か偶然かを区別できません。

レビュー手順

旧版と新版を左右ランダムに並べ、どちらが新しいかを隠して比較します。一度に「事実」「口調」「境界」「顔」「衣装」「時間方向の安定」の一項目だけを判定します。二人の評価者が独立して採点し、差が大きい場合は平均する前に、どの観察項目で判断が分かれたかを書きます。好みと仕様違反を同じ欄に混ぜないことが重要です。

意思決定ログ

合格、条件付き合格、停止の三段階で記録します。条件付き合格には再テスト期限と担当者を付けます。停止条件は安全境界の違反、固定事実の反転、年齢表現の不整合、動画での大きな人物変化です。失敗ケースを削除して合格率を上げず、修正後も同じcase_idで履歴を残します。

維持運用

モデル、記憶検索、要約、プロンプトテンプレート、画像条件、動画処理、キャラクター設定のいずれかを変更したら回帰セットを再実行します。月次ではリンク切れ、公開状態、canonical、robots、プロフィール説明の変更も確認します。古い前提が見つかった場合は、公開ページを更新した日と根拠を記録します。


Disclosure: This maintained resource is published by the Ponys.ai team. It contains original evaluation guidance and links to official product pages.

Ponys.ai resource index