내 트래픽에서 평가하기
내 트래픽에서 평가하기 (Evaluate on Your Traffic)
공개 벤치마크는 다른 사람의 프롬프트를 측정해요. 두 가지 기능은 여러분의 것을 측정합니다: 전환 전 섀도 평가, 전환 후 절감 회계.
섀도 평가 (Shadow evaluations)
- 한 키/팀/사용자의 라이브 트래픽 일부를 샘플링합니다.
- 샘플링된 각 요청을 라우터를 통해 복제합니다. 섀도 응답은 클라이언트에 도달하지 않아요.
- 블라인드 판정: LLM이 라우터의 답변을 현재 모델이 제공한 것과 비교합니다.
- 최대 30일(기본 7일) 또는 턴 상한(기본 200, 최대 2,000)까지 실행됩니다.
- 같은 샘플 트래픽에서 한 작업으로 여러 라우터 구성을 비교하므로, 티어 매핑과 분류기 선택이 아무것도 바뀌기 전에 결정됩니다.
- 우리 트래픽에서는: 88.1%가 현재 모델과 일치하거나 능가, 판정된 턴 143개, 판정 지출 $1.55.
Shadow Evaluations: Test the Auto-Router on Your Own Production Traffic — 작업 설정, 턴·기간 기본값, 판정자 선택, 결과 카드 읽기.
Route on Context Size and Modality — 멀티 구성 섀도 작업과 키·팀·사용자 대상.
자신의 프롬프트로 JEV 평가
Test Routing으로 티어 선택을 먼저 검사한 뒤, 섀도 평가로 실제 답변을 비교하세요. 티어 라벨과 일치하는 분류기가 선택된 모델이 잘 답한다는 것을 보장하지는 않아요. JEV를 다른 분류기와 비교하기 전에 루브릭과 라벨을 고정하고, 불일치는 정확성과 별도로 보고하세요.
JEV 벤치마크는 작성된 합성 케이스에서 분류기 지연 시간과 레지스트리 가격 분류기 비용을 측정했어요. 배포를 평가하려면 분류기 지출, 다운스트림 컴플리션, 활성화된 경우 임베딩, 섀도/판정 요청을 포함하세요. 폴백 비율과 p95 지연 시간도 성공 호출 평균과 함께 기록하세요.
JEV는 부모 요청의 metadata를 통해 귀속되는 별도의 typesafe/<model> 분류기 호출을 로그로 남깁니다. classifier_cost도 성공적인 JEV 라우팅 결정에 실려 보고된 라우터 절감에서 차감되어요. 그 metadata는 이미 별도로 로그된 분류기 비용을 설명합니다. 지출 행 합산 시 다시 세지 마세요. usage 누락이나 레지스트리 항목 누락은 분류기 비용을 알 수 없게 하며, 취소(cancellation)가 프로바이더가 0을 청구했다는 증거는 아닙니다.
전환 후 절감
- 요청별: 라우터가 무엇을 골랐는지, 왜 그랬는지, 그리고 같은 요청이 구성된 가장 어려운 티어의 가장 비싼 모델에서 들었을 비용. 분류기 호출을 뺀 차액이 요청에 찍힙니다.
- 롤업: 일일 지출 표로 합산되어 키, 팀, 태그, 조직별로 나타납니다.
- Usage 탭: 총 추정 절감, 세션과 턴, 턴 유형별 프롬프트 캐시 적중률. 40만 세션에 걸친 30일 창을 38ms에 읽어요.
- 분류기 비용: 분류기 비용이 기록됐을 때(성공적인 JEV 분류 포함)
x-litellm-classifier-cost헤더로 요청당 반환됩니다. - 정직한 기준선: 지속되는 턴은 따뜻한 캐시로 가격을 매깁니다. 전환 후의 새 캐시 쓰기는 절감에 부정적으로 계산되어, 단일 요청이 음수로 읽힐 수 있어요. 공식과 모든 표면은 Reported savings 문서 참고.
AutoRouter: Easy Visibility to Your Savings — usage 탭, 요청별 분류기 비용, 프리셋의 자체 배포 매칭.
결정 로그 (Decision log) — 라우팅 결정마다 grep 가능한 줄 하나: cause, 티어, 점수, 신호, 라우팅된 모델.
단일 결정 읽기
- 로그의 각 라우팅된 요청은 routing-decision 카드로 시작합니다: 티어, cause(
jev_classifier포함), 제공한 모델. - Add Model 폼의 Test Routing 은 같은 카드를 보여주므로, 놀라운 프로덕션 결정을 같은 프롬프트로 폼에서 재생해 볼 수 있어요.
출처: 문서