공개 벤치마크

공개 벤치마크 (Public Benchmarks)

이 포스트들은 실제 프로바이더 API와 그 구성으로 측정한 결과를 공개해요. JEV 분류기 비교는 분류기를 직접 타이밍하고 별도의 라이브 프록시 검사도 포함합니다. 아래 숫자는 포스트에서 인용된 것입니다.

JEV 분류기: Haiku보다 5.43배 빠르고, 비용 96% 낮음

2026-09-18에 TypeSafe jev-1.13.0anthropic/claude-haiku-4-5-20251001이 같은 80개 작성 합성 케이스를 분류했어요(3회 짝지은 반복, 동시성 1).

지표 JEV Haiku
작성 기대 티어와 일치 95.00% (228/240) 73.75% (177/240)
p50 분류기 지연 시간 126.81 ms 688.40 ms
p95 분류기 지연 시간 231.16 ms 896.94 ms
레지스트리 가격 분류기 비용, 240호출 $0.007706664 $0.198534
프로바이더 오류 / 타임아웃 / 폴백 0 / 0 / 0 0 / 0 / 0

JEV는 중앙값 지연 시간 기준 Haiku보다 5.43배, p95 기준 3.88배 빠르게 요청을 분류했고, 레지스트리 가격 분류기 비용은 96.12% 낮았어요. 분류기 간 티어 일치는 78.75%로, 작성 라벨과의 일치와는 별개의 측정입니다. 경계 케이스 여덟 개의 일치율 차이 구간은 0을 포함했어요.

이 결과는 공유된 커스텀 루브릭과 명시적 컨텍스트 설정으로 이 말뭉치에 대해 분류기를 측정합니다. 요청, 티어 정의, 지침, 컨텍스트는 어느 분류기의 일치율도 바꿀 수 있어요. 기대 라벨은 독립적으로 검토되지 않았고, 대체 분류기 프롬프트는 평가되지 않았습니다. 이 결과는 일반 분류 정확성, 다운스트림 답변 품질, 청구 절감, 동시 부하 성능을 입증하지 않아요. 별도의 게이트웨이 검사는 모든 티어에 같은 다운스트림 모델을 사용했으므로, 컴플리션 모델 전환으로 인한 절감을 입증할 수 없습니다.

방법론, 티어별 결과, 불확실성과 한계를 읽거나, 고정된 증거와 재현 스크립트를 다운로드하세요.

Terminal-Bench 2.0: Opus 수준 품질을 27% 낮은 비용으로

  • 라우터와 Claude Opus-5 단독 모두 21개 중 16개 해결. 같은 해결률.
  • $14.34 vs $19.74 총 비용. 27% 낮음.
  • 분류기: gpt-5.4-mini, 현재 메시지만 읽음.
  • 컨텍스트를 마지막 3개 사용자 메시지로 확장: 해결률 66.7% → 76.2%, 비용 +44%.
  • 분류기의 관점에 assistant 답변 추가: 품질 하락, 비용 증가. 출시 기본값은 이를 제외합니다.

Auto Router: Opus level quality at up to 27% lower cost — 컨텍스트 창별 전체 결과, 라우터 vs 각 단일 모델, 정확한 구성.

Introducing LiteLLM Fusion: 56% More Tasks Solved Than Fable 5 — 같은 21개 작업, 병렬 3개 모델 + 합성기 1개: 지출 +36%, 해결 작업당 12% 저렴, 턴 지연 5배.

Heuristic v2: 작업당 비용 45% 낮게 27% 더 많은 작업 해결

분류기 해결률 해결/21 총 비용 $/해결 평균 호출 지연 p90 호출 지연 중간 작업 시간
Heuristic v2 66.7% 14/21 $9.78 $0.70 13.1s 30.7s 7m08s
Heuristic v1 52.4% 11/21 $14.06 $1.28 14.5s 34.1s 8m53s
  • 같은 21개 Task Terminal-Bench 2.0 서브셋, 동일한 티어, classifier_type만 다름.
  • 요청 경로에 LLM 분류기 호출 없음. 등급 매긴 응답 데이터로 사전 학습되어 콜드 스타트 없음.
  • 입력 토큰의 87%가 캐시 읽기였고(v1은 82%): 더 안정적인 티어 선택은 캐시 미스를 줄임.
  • 933회 LLM 호출에서 양쪽 모두 실패 요청 0건.
  • classifier_type: heuristic_v2로 활성화.

Introducing AutoRouter Heuristic v2: 27% More Tasks Solved at 45% Lower Cost — 분류기에서 바뀐 점, 티어별 결과, 지연 시간, 무료 평가 범위.

공개 벤치마크 6개와 RouterArena: 40%~75% 저렴

평가 샘플 all-Opus-5 대비 비용 frontier 대비 품질
공개 벤치마크 6개, 라이브 프록시 220개 등급 프롬프트 40.4% 저렴 97.1% (91.8% vs 94.5% pass)
RouterArena 8,399개 쿼리 74.5% 저렴 87.3%
WildChat-1M 시뮬레이션 12,000개 대화 64.9% 저렴 미측정
DevGPT 시뮬레이션 2,056개 대화 65.4% 저렴 미측정
코드 필터링된 WildChat 993개 대화 20.0% 저렴 미측정

Cut 75% Claude Code cost with near frontier model quality — 벤치마크별 등급, 대화 시뮬레이션, 절감 원천.

분류기 컨텍스트: 후속 턴 일치 14%~78%

  • 라이브 분류기 호출 5,600건.
  • 히스토리에 대해서만 해결되는 후속 턴 일치: 0턴에서 14%, 1턴 47%, 2턴 78%, 10까지 평평.
  • 분류기 비용: 요청 1,000건당 최대 $0.61.
  • 컨텍스트 없는 경우 대비 지연 델타: 모든 95% 구간이 0을 포함.
  • 출시 기본값: 이전 사용자 턴 3개, 각 200자, assistant 턴 없음.

Auto Router v1.97: usage benchmarks and better quality for lower cost — 창 크기별 일치, 요청당 분류기 비용, 지연 델타, Benchmarks 뷰.

프로덕션: 272,876개 요청에서 51% 절감

  • 450명 이상의 사용자, dev/staging/production, 2026-04-15 ~ 2026-08-09.
  • 요청 272,876건, 7.08B 토큰.
  • $11,736 지출 vs flagship-only 반사실 $23,985: $12,249 절감, 51.1%.
  • 티어 맵을 튜닝하면서 절감률이 첫 전체 월 42.9%에서 마지막 월 60.7%로 상승.
  • 요청의 95%는 flagship 티어에 도달하지 않음.

51% Cost Savings Reported From a Live Production Deployment — 월별 절감, 티어 분포, 실행했던 구성과 변경 사항.

섀도 평가: 88.1% 일치하거나 능가

  • 사용자 대상 응답이 바뀌기 전에 우리 라이브 게이트웨이 트래픽에 대한 블라인드 LLM 판정.
  • 판정된 턴 143개, 판정 지출 $1.55.
  • 라우터 승리 9.8%, 무승부 78.3%, 현재 모델 승리 11.9%.
  • 자신의 트래픽에서 실행하는 방법: Evaluate on Your Traffic.

Shadow Evaluations: Test the Auto-Router on Your Own Production Traffic — 샘플링, 복제, 블라인드 판정, 결과 카드.

프롬프트 캐싱: 캐싱만 할 때보다 37%~69% 저렴

  • 프로바이더 자체 캐시 회계가 있는 라이브 게이트웨이 트래픽 포함 5개 데이터셋.
  • 라우터 + 캐싱은 모든 데이터셋에서 고정 모델 하나에 캐싱만 하는 것을 능가.
  • 전체 설명: Prompt Caching.

출처: 문서

더 알아보기 (Learn more)