실험 비교하기(Compare experiments)
실험 비교하기(Compare experiments)
실험 실행을 비교해 프롬프트, 모델, 검색, 코드 변경이 출시할 준비가 됐는지 결정할 수 있습니다. 이 문서는 비교할 실행을 고르고, 점수와 출력을 검사하고, 실패를 조사·검토하며, 결과를 리뷰어와 공유하고, 결정을 CI 정책으로 전환하는 방법을 설명해요. 먼저 집계 점수를 살펴보고, 악화된 케이스를 검사한 뒤 trace를 열어 원인을 파악합니다.
출처: 문서
본문
실험 실행을 비교해 프롬프트, 모델, 검색, 또는 코드 변경이 출시될 준비가 됐는지 결정하세요. 집계 점수부터 시작해 악화된 케이스를 검사하고, 원인을 이해하기 위해 trace를 여세요.
실험 실행은 Langfuse 데이터셋이나 로컬 데이터를 사용할 수 있습니다. Python이나 TypeScript로 두 개의 비교 가능한 실행을 만드는 방법은 Evaluate an existing application 을 참고하거나 예제 프로젝트 를 탐색해 보세요.
비교할 실행 선택
Experiments 를 열고 비교할 실행을 선택한 뒤 비교 뷰를 여세요. 검토된 릴리스 실행을 baseline으로 선택합니다.
릴리스 결정을 위해 baseline과 candidate에 같은 데이터셋 버전과 평가자 정의를 사용하세요. 실험 메타데이터에 애플리케이션 커밋, 프롬프트/모델 버전, 평가자 버전을 기록하세요. 데이터셋 버전은 테스트 데이터를 고정하지만 모델 출력을 결정적으로 만들지는 않습니다.
다른 데이터 소스의 실행을 비교할 수 있지만, 먼저 케이스가 같은 입력과 expected output을 나타내는지 확인하세요. 누락된 케이스는 통과 케이스가 아닙니다. 로컬 데이터의 경우 테스트 아티팩트에 케이스 식별자를 보존해 내 CI 정책이 케이스를 명시적으로 매칭할 수 있게 하세요.
결과를 해석하기 전에 출시 정책 을 선택하세요. 모든 필수 케이스가 통과해야 하나요, 아니면 candidate가 이전에 승인된 통과를 모두 보존해야 하나요? 알려진 실패는 명시적 승인이 필요합니다. 더 새로운 실행이 자동으로 승인된 baseline이 되지는 않습니다.
점수와 출력 검사
점수, 비용, 지연시간 차이를 검토해 tradeoff를 식별하세요. 평균 품질의 개선이 중요 케이스의 회귀를 숨길 수 있습니다.
| 케이스 | Baseline | Candidate | 결정 |
|---|---|---|---|
| Standard refund policy | Pass | Fail | 회귀 조사 |
| Sale-item refund policy | Fail | Pass | 개선 검토 |
위 두 실행 모두 50% 정확도입니다. 평균만으로는 candidate를 출시해도 안전한지 알 수 없습니다.
비교 뷰에서 점수 임계값을 사용해 결과를 좁힌 뒤 baseline과 candidate 출력을 나란히 검사하세요. 점수 설명(score explanation)을 출력과 대조해 확인하세요. 평가자가 실패하거나 결과를 반환하지 않았다면 비교가 완료된 것으로 간주하기 전에 그 오류를 해결하세요.
실패 조사·검토
실패한 항목의 trace를 여세요. 애플리케이션 출력과 이를 만든 중간 검색, 모델 호출, 도구를 검사하세요. 예를 들어 잘못된 환불 기간은 오래된 검색된 정책 텍스트나 모델이 올바른 정책을 무시한 데서 비롯될 수 있습니다.
애플리케이션 실패와 평가자 실수를 구분하세요. 좋은 의역이 문자열 검사에 실패할 수 있고, 유창한 답변에도 근거 없는 주장이 포함될 수 있습니다. 인간 점수 를 사용해 검토 결과와 실패 이유를 기록하세요. 팀 전체에 검토를 공유해야 한다면 annotation queues 를 사용하세요.
검토 후 평가자를 변경했다면 두 버전 모두를 같은 업데이트된 정의로 다시 점수 매기세요. 원래 실험 메타데이터를 유지해 결정을 재현할 수 있게 하세요.
리뷰어와 결과 공유
조직 초대와 역할 을 통해 리뷰어에게 프로젝트 접근 권한을 주세요. Viewer는 결과를 검사할 수 있고, Member는 점수와 코멘트를 추가할 수 있습니다. 링크를 보낸다고 프로젝트 접근이 부여되지는 않습니다.
실험 링크를 baseline/candidate 실행 이름, 버전 식별자, 검토할 케이스, 출시 정책과 함께 보내세요. 리뷰어에게 Experiments를 열고 그 실행을 선택하고 명시된 baseline을 고르라고 요청하세요. 리뷰어가 내 선택을 재현할 수 있도록 점수 필터도 인계에 포함하세요.
답변을 검토하는 QA 팀의 경우 관련 실험 아이템 observations를 annotation queue 에 추가하세요. 출력을 판단하는 데 필요한 소스 자료와 참고 답변을 포함하세요. 리뷰어는 내 코드를 실행하지 않고 점수를 기록하고, 실패를 설명하고, 수정 답변을 제안할 수 있습니다.
결정을 CI 정책으로 전환
baseline을 명시적으로 승인하고 데이터셋/평가자 버전과 함께 그 정체성을 기록하세요. 성공한 모든 candidate로 자동 교체하지 마세요. 유용한 정책은 최소 집계 점수에 새로 실패한 중요 케이스와 불완전한 결과에 대한 검사를 결합합니다.
예시는 Experiments in CI/CD 를 참고하세요. baseline 승인과 게이트 정책은 저장소에 있습니다. 비교 UI에서 baseline을 고른다고 CI 게이트가 구성되지는 않습니다.
더 알아보기 (Learn more)
- 출처 문서: 실험 비교하기(Compare experiments)