공개 벤치마크
공개 벤치마크 (Public Benchmarks)
이 포스트들은 실제 프로바이더 API와 그 구성으로 측정한 결과를 공개해요. JEV 분류기 비교는 분류기를 직접 타이밍하고 별도의 라이브 프록시 검사도 포함합니다. 아래 숫자는 포스트에서 인용된 것입니다.
JEV 분류기: Haiku보다 5.43배 빠르고, 비용 96% 낮음
2026-09-18에 TypeSafe jev-1.13.0과 anthropic/claude-haiku-4-5-20251001이 같은 80개 작성 합성 케이스를 분류했어요(3회 짝지은 반복, 동시성 1).
| 지표 | JEV | Haiku |
|---|---|---|
| 작성 기대 티어와 일치 | 95.00% (228/240) | 73.75% (177/240) |
| p50 분류기 지연 시간 | 126.81 ms | 688.40 ms |
| p95 분류기 지연 시간 | 231.16 ms | 896.94 ms |
| 레지스트리 가격 분류기 비용, 240호출 | $0.007706664 | $0.198534 |
| 프로바이더 오류 / 타임아웃 / 폴백 | 0 / 0 / 0 | 0 / 0 / 0 |
JEV는 중앙값 지연 시간 기준 Haiku보다 5.43배, p95 기준 3.88배 빠르게 요청을 분류했고, 레지스트리 가격 분류기 비용은 96.12% 낮았어요. 분류기 간 티어 일치는 78.75%로, 작성 라벨과의 일치와는 별개의 측정입니다. 경계 케이스 여덟 개의 일치율 차이 구간은 0을 포함했어요.
이 결과는 공유된 커스텀 루브릭과 명시적 컨텍스트 설정으로 이 말뭉치에 대해 분류기를 측정합니다. 요청, 티어 정의, 지침, 컨텍스트는 어느 분류기의 일치율도 바꿀 수 있어요. 기대 라벨은 독립적으로 검토되지 않았고, 대체 분류기 프롬프트는 평가되지 않았습니다. 이 결과는 일반 분류 정확성, 다운스트림 답변 품질, 청구 절감, 동시 부하 성능을 입증하지 않아요. 별도의 게이트웨이 검사는 모든 티어에 같은 다운스트림 모델을 사용했으므로, 컴플리션 모델 전환으로 인한 절감을 입증할 수 없습니다.
방법론, 티어별 결과, 불확실성과 한계를 읽거나, 고정된 증거와 재현 스크립트를 다운로드하세요.
Terminal-Bench 2.0: Opus 수준 품질을 27% 낮은 비용으로
- 라우터와 Claude Opus-5 단독 모두 21개 중 16개 해결. 같은 해결률.
- $14.34 vs $19.74 총 비용. 27% 낮음.
- 분류기:
gpt-5.4-mini, 현재 메시지만 읽음. - 컨텍스트를 마지막 3개 사용자 메시지로 확장: 해결률 66.7% → 76.2%, 비용 +44%.
- 분류기의 관점에 assistant 답변 추가: 품질 하락, 비용 증가. 출시 기본값은 이를 제외합니다.
Auto Router: Opus level quality at up to 27% lower cost — 컨텍스트 창별 전체 결과, 라우터 vs 각 단일 모델, 정확한 구성.
Introducing LiteLLM Fusion: 56% More Tasks Solved Than Fable 5 — 같은 21개 작업, 병렬 3개 모델 + 합성기 1개: 지출 +36%, 해결 작업당 12% 저렴, 턴 지연 5배.
Heuristic v2: 작업당 비용 45% 낮게 27% 더 많은 작업 해결
| 분류기 | 해결률 | 해결/21 | 총 비용 | $/해결 | 평균 호출 지연 | p90 호출 지연 | 중간 작업 시간 |
|---|---|---|---|---|---|---|---|
| Heuristic v2 | 66.7% | 14/21 | $9.78 | $0.70 | 13.1s | 30.7s | 7m08s |
| Heuristic v1 | 52.4% | 11/21 | $14.06 | $1.28 | 14.5s | 34.1s | 8m53s |
- 같은 21개 Task Terminal-Bench 2.0 서브셋, 동일한 티어,
classifier_type만 다름. - 요청 경로에 LLM 분류기 호출 없음. 등급 매긴 응답 데이터로 사전 학습되어 콜드 스타트 없음.
- 입력 토큰의 87%가 캐시 읽기였고(v1은 82%): 더 안정적인 티어 선택은 캐시 미스를 줄임.
- 933회 LLM 호출에서 양쪽 모두 실패 요청 0건.
classifier_type: heuristic_v2로 활성화.
Introducing AutoRouter Heuristic v2: 27% More Tasks Solved at 45% Lower Cost — 분류기에서 바뀐 점, 티어별 결과, 지연 시간, 무료 평가 범위.
공개 벤치마크 6개와 RouterArena: 40%~75% 저렴
| 평가 | 샘플 | all-Opus-5 대비 비용 | frontier 대비 품질 |
|---|---|---|---|
| 공개 벤치마크 6개, 라이브 프록시 | 220개 등급 프롬프트 | 40.4% 저렴 | 97.1% (91.8% vs 94.5% pass) |
| RouterArena | 8,399개 쿼리 | 74.5% 저렴 | 87.3% |
| WildChat-1M 시뮬레이션 | 12,000개 대화 | 64.9% 저렴 | 미측정 |
| DevGPT 시뮬레이션 | 2,056개 대화 | 65.4% 저렴 | 미측정 |
| 코드 필터링된 WildChat | 993개 대화 | 20.0% 저렴 | 미측정 |
Cut 75% Claude Code cost with near frontier model quality — 벤치마크별 등급, 대화 시뮬레이션, 절감 원천.
분류기 컨텍스트: 후속 턴 일치 14%~78%
- 라이브 분류기 호출 5,600건.
- 히스토리에 대해서만 해결되는 후속 턴 일치: 0턴에서 14%, 1턴 47%, 2턴 78%, 10까지 평평.
- 분류기 비용: 요청 1,000건당 최대 $0.61.
- 컨텍스트 없는 경우 대비 지연 델타: 모든 95% 구간이 0을 포함.
- 출시 기본값: 이전 사용자 턴 3개, 각 200자, assistant 턴 없음.
Auto Router v1.97: usage benchmarks and better quality for lower cost — 창 크기별 일치, 요청당 분류기 비용, 지연 델타, Benchmarks 뷰.
프로덕션: 272,876개 요청에서 51% 절감
- 450명 이상의 사용자, dev/staging/production, 2026-04-15 ~ 2026-08-09.
- 요청 272,876건, 7.08B 토큰.
- $11,736 지출 vs flagship-only 반사실 $23,985: $12,249 절감, 51.1%.
- 티어 맵을 튜닝하면서 절감률이 첫 전체 월 42.9%에서 마지막 월 60.7%로 상승.
- 요청의 95%는 flagship 티어에 도달하지 않음.
51% Cost Savings Reported From a Live Production Deployment — 월별 절감, 티어 분포, 실행했던 구성과 변경 사항.
섀도 평가: 88.1% 일치하거나 능가
- 사용자 대상 응답이 바뀌기 전에 우리 라이브 게이트웨이 트래픽에 대한 블라인드 LLM 판정.
- 판정된 턴 143개, 판정 지출 $1.55.
- 라우터 승리 9.8%, 무승부 78.3%, 현재 모델 승리 11.9%.
- 자신의 트래픽에서 실행하는 방법: Evaluate on Your Traffic.
Shadow Evaluations: Test the Auto-Router on Your Own Production Traffic — 샘플링, 복제, 블라인드 판정, 결과 카드.
프롬프트 캐싱: 캐싱만 할 때보다 37%~69% 저렴
- 프로바이더 자체 캐시 회계가 있는 라이브 게이트웨이 트래픽 포함 5개 데이터셋.
- 라우터 + 캐싱은 모든 데이터셋에서 고정 모델 하나에 캐싱만 하는 것을 능가.
- 전체 설명: Prompt Caching.
출처: 문서