Kurose:AIキャラクター評価ワークシート

Kurose trains people for a living, but sometimes the attention from certain clients makes it hard to stay focused… and she hates how much she enjoys it.

このページは紹介文を繰り返すためのものではありません。Kuroseを会話・記憶・画像・動画の同じ基準で確認するための、再利用可能な評価手順です。

今回の評価テーマ

重点はrelationship progressionです。基本ケースは「a first chat, a resumed chat, and a conflict-repair chat」、観察項目はrole clarity, consent, and retained commitmentsです。モデルや設定を変更しても比較できるよう、入力、シード、設定版、出力を同時に保存します。

会話テスト

  1. プロフィールから固定事実を3件抽出する。
  2. 同じ意図を直接質問、言い換え、20ターン後の再質問で確認する。
  3. 知らない情報には推測ではなく確認質問を返すかを見る。
  4. 拒否が必要な場面でも口調と関係性が急変しないか確認する。

画像と動画のチェックリスト

スコアと失敗診断

事実整合性30%、人格整合性30%、境界20%、視覚20%で評価します。取得漏れ、優先順位逆転、要約損失、生成ドリフト、視覚ドリフトを別々に記録すると修正箇所を特定できます。

関連リンク

よくある質問

一回の成功で合格にできますか?

できません。少なくとも3シードと複数の会話位置で再現性を確認します。

設定を更新したら何を再テストしますか?

固定事実、境界、長期記憶、画像の安定属性、動画の時間方向の一貫性を同じケースで再実行します。

再現可能なテスト記録

評価結果だけでなく、入力文、キャラクター設定版、モデル版、テンプレート版、乱数シード、実行日時を一つの記録にまとめます。会話テストでは開始時の前提、直前の要約、検索された記憶も保存します。画像では解像度、縦横比、ネガティブ条件を、動画では基準画像、長さ、動作量、カメラ移動を記録します。同じケースを再現できなければ、改善か偶然かを区別できません。

レビュー手順

旧版と新版を左右ランダムに並べ、どちらが新しいかを隠して比較します。一度に「事実」「口調」「境界」「顔」「衣装」「時間方向の安定」の一項目だけを判定します。二人の評価者が独立して採点し、差が大きい場合は平均する前に、どの観察項目で判断が分かれたかを書きます。好みと仕様違反を同じ欄に混ぜないことが重要です。

意思決定ログ

合格、条件付き合格、停止の三段階で記録します。条件付き合格には再テスト期限と担当者を付けます。停止条件は安全境界の違反、固定事実の反転、年齢表現の不整合、動画での大きな人物変化です。失敗ケースを削除して合格率を上げず、修正後も同じcase_idで履歴を残します。

維持運用

モデル、記憶検索、要約、プロンプトテンプレート、画像条件、動画処理、キャラクター設定のいずれかを変更したら回帰セットを再実行します。月次ではリンク切れ、公開状態、canonical、robots、プロフィール説明の変更も確認します。古い前提が見つかった場合は、公開ページを更新した日と根拠を記録します。


Disclosure: This maintained resource is published by the Ponys.ai team. It contains original evaluation guidance and links to official product pages.

Ponys.ai resource index