영상 연속성: 세션 재개 벤치마크
이 유지 관리형 벤치마크는 저장 지점에서 다시 시작한 대화에서 시간에 따른 인물 정체성과 신체 표현을 검증합니다. 주관적 인상을 고정 입력, 증거 필드, 필수 게이트와 재시험 조건을 가진 반복 가능한 기록으로 바꿉니다.
검증 질문
짧고 긴 재개 간격에서 ‘첫·중간·마지막 프레임을 따로 채점한다’을 적용할 때 시간에 따른 인물 정체성과 신체 표현을 유지할 수 있는지 확인합니다. 통과하려면 미완료 약속 전부 회수이 필요하며, 보기 좋거나 감정적으로 매력적인 결과가 중대 실패를 상쇄할 수 없습니다.
통제된 준비
캐릭터 카드, 모델 ID, 템플릿 버전, 검색 설정, 안전 정책, 참조 자료, 시드 정책과 언어를 고정합니다. 시작 전에 case_id를 부여하고 한 번에 한 변수만 바꾸며 성공과 실패를 모두 보존합니다.
반복 가능한 절차
- 사용 전에 기대 사실, 경계, 말투와 시각 기준을 작성합니다.
- 기준 실행의 입력, 검색 맥락, 출력, 지연과 판정 상태를 저장합니다.
- 다른 구성은 그대로 두고 대상 시나리오만 적용합니다.
- 후보 순서를 무작위로 하고 두 명이 독립적으로 채점합니다.
- 불일치를 만든 문장, 프레임, 속성 또는 상태 전환을 지정합니다.
- 세 번 반복하고 평균과 최저 사례 점수를 함께 보고합니다.
증거 기록
model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure, remediation_owner를 저장합니다. 설정 없는 스크린샷은 보조 증거일 뿐 완전한 기록이 아닙니다.
점수와 출시 게이트
주요 지표는 시간 정체성과 오류 수입니다. 사례별 0~4점, pass_count / total_cases와 모든 중대 실패를 따로 기록합니다. 미완료 약속 전부 회수, 두 평가자의 필수 조건 합의, 최저 실행의 사전 기준 통과가 모두 충족될 때만 출시합니다.
실패 진단
특히 좋은 첫 프레임이 후반 드리프트를 가리는 문제을 확인합니다. 설정 누락, 검색 실패, 우선순위 역전, 요약 손실, 생성 드리프트, 시각 드리프트, 정책 불일치, 평가 모호성으로 나누고 한 계층만 수정한 뒤 같은 case_id를 재실행합니다.
테스트에 사용한 공식 워크플로
- AI video generator
- AI girlfriend experience
- NSFW AI character generator
- NSFW AI video generator
- AI character creation
FAQ
좋은 결과 하나면 충분한가요?
한 사례로는 반복 가능성과 우연을 구분할 수 없습니다. 통제된 반복과 실패 보존이 필요합니다.
언제 다시 테스트하나요?
모델, 프롬프트, 기억, 요약, 안전, 이미지 조건, 영상 또는 설정 변경 뒤입니다.