출시 전 회귀 게이트: 25턴 기준선 벤치마크

이 유지 관리형 벤치마크는 설정을 고정한 새 세션에서 모델·프롬프트·검색 변경 뒤 품질을 검증합니다. 주관적 인상을 고정 입력, 증거 필드, 필수 게이트와 재시험 조건을 가진 반복 가능한 기록으로 바꿉니다.

검증 질문

1·10·25턴에서 ‘한 가지 변경 전후로 고정 테스트 모음을 실행한다’을 적용할 때 모델·프롬프트·검색 변경 뒤 품질을 유지할 수 있는지 확인합니다. 통과하려면 세 번 연속 재현이 필요하며, 보기 좋거나 감정적으로 매력적인 결과가 중대 실패를 상쇄할 수 없습니다.

통제된 준비

캐릭터 카드, 모델 ID, 템플릿 버전, 검색 설정, 안전 정책, 참조 자료, 시드 정책과 언어를 고정합니다. 시작 전에 case_id를 부여하고 한 번에 한 변수만 바꾸며 성공과 실패를 모두 보존합니다.

반복 가능한 절차

  1. 사용 전에 기대 사실, 경계, 말투와 시각 기준을 작성합니다.
  2. 기준 실행의 입력, 검색 맥락, 출력, 지연과 판정 상태를 저장합니다.
  3. 다른 구성은 그대로 두고 대상 시나리오만 적용합니다.
  4. 후보 순서를 무작위로 하고 두 명이 독립적으로 채점합니다.
  5. 불일치를 만든 문장, 프레임, 속성 또는 상태 전환을 지정합니다.
  6. 세 번 반복하고 평균과 최저 사례 점수를 함께 보고합니다.

증거 기록

model_version, prompt_version, character_version, case_id, seed, locale, timestamp, retrieved_memory, expected_state, observed_state, reviewer_id, hard_failure, remediation_owner를 저장합니다. 설정 없는 스크린샷은 보조 증거일 뿐 완전한 기록이 아닙니다.

점수와 출시 게이트

주요 지표는 쌍대 승률과 중대 실패 수입니다. 사례별 0~4점, pass_count / total_cases와 모든 중대 실패를 따로 기록합니다. 세 번 연속 재현, 두 평가자의 필수 조건 합의, 최저 실행의 사전 기준 통과가 모두 충족될 때만 출시합니다.

실패 진단

특히 평균 향상이 치명적 회귀를 숨기는 문제을 확인합니다. 설정 누락, 검색 실패, 우선순위 역전, 요약 손실, 생성 드리프트, 시각 드리프트, 정책 불일치, 평가 모호성으로 나누고 한 계층만 수정한 뒤 같은 case_id를 재실행합니다.

테스트에 사용한 공식 워크플로

FAQ

좋은 결과 하나면 충분한가요?

한 사례로는 반복 가능성과 우연을 구분할 수 없습니다. 통제된 반복과 실패 보존이 필요합니다.

언제 다시 테스트하나요?

모델, 프롬프트, 기억, 요약, 안전, 이미지 조건, 영상 또는 설정 변경 뒤입니다.


공개: 이 테스트 워크시트는 Ponys.ai 팀이 유지하고 발행합니다. 아래 링크는 공식 Ponys.ai 기능이며 경쟁 제품을 평가하거나 이름을 언급하지 않습니다.

Benchmark index · Ponys.ai resource index