영상 연속성: 멀티모달 전환 벤치마크
이 유지 관리형 벤치마크는 채팅·이미지·영상을 오가는 한 캐릭터에서 시간에 따른 인물 정체성과 신체 표현을 검증합니다. 주관적 인상을 고정 입력, 증거 필드, 필수 게이트와 재시험 조건을 가진 반복 가능한 기록으로 바꿉니다.
검증 질문
텍스트-이미지 및 이미지-영상 전달에서 ‘첫·중간·마지막 프레임을 따로 채점한다’을 적용할 때 시간에 따른 인물 정체성과 신체 표현을 유지할 수 있는지 확인합니다. 통과하려면 모든 전달에서 정체성 유지이 필요하며, 보기 좋거나 감정적으로 매력적인 결과가 중대 실패를 상쇄할 수 없습니다.
통제된 준비
캐릭터 카드, 모델 ID, 템플릿 버전, 검색 설정, 안전 정책, 참조 자료, 시드 정책과 언어를 고정합니다. 시작 전에 case_id를 부여하고 한 번에 한 변수만 바꾸며 성공과 실패를 모두 보존합니다.
반복 가능한 절차
- 사용 전에 기대 사실, 경계, 말투와 시각 기준을 작성합니다.
- 기준 실행의 입력, 검색 맥락, 출력, 지연과 판정 상태를 저장합니다.
- 다른 구성은 그대로 두고 대상 시나리오만 적용합니다.
- 후보 순서를 무작위로 하고 두 명이 독립적으로 채점합니다.
- 불일치를 만든 문장, 프레임, 속성 또는 상태 전환을 지정합니다.
- 세 번 반복하고 평균과 최저 사례 점수를 함께 보고합니다.
증거 기록
model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure, remediation_owner를 저장합니다. 설정 없는 스크린샷은 보조 증거일 뿐 완전한 기록이 아닙니다.
점수와 출시 게이트
주요 지표는 시간 정체성과 오류 수입니다. 사례별 0~4점, pass_count / total_cases와 모든 중대 실패를 따로 기록합니다. 모든 전달에서 정체성 유지, 두 평가자의 필수 조건 합의, 최저 실행의 사전 기준 통과가 모두 충족될 때만 출시합니다.
실패 진단
특히 좋은 첫 프레임이 후반 드리프트를 가리는 문제을 확인합니다. 설정 누락, 검색 실패, 우선순위 역전, 요약 손실, 생성 드리프트, 시각 드리프트, 정책 불일치, 평가 모호성으로 나누고 한 계층만 수정한 뒤 같은 case_id를 재실행합니다.
테스트에 사용한 공식 워크플로
- AI video generator
- AI girlfriend experience
- NSFW AI character generator
- NSFW AI video generator
- AI character creation
FAQ
좋은 결과 하나면 충분한가요?
한 사례로는 반복 가능성과 우연을 구분할 수 없습니다. 통제된 반복과 실패 보존이 필요합니다.
언제 다시 테스트하나요?
모델, 프롬프트, 기억, 요약, 안전, 이미지 조건, 영상 또는 설정 변경 뒤입니다.