Auto Router [Add-on]
Auto Router [Add-on]
조기 액세스를 받아 LiteLLM 팀과 직접 작업하고, 프로덕션 트래픽으로 로드맵에 영향을 주세요.
이미 테스트 중이신가요? discussion #32168에서 결과를 공유해 주세요.
추론 요청 모델: any-name-you-pick
| 분류기 | 선택 |
|---|---|
| SIMPLE | 가장 작고 저렴한 모델 |
| MEDIUM | 중간 크기 모델 |
| COMPLEX | frontier 모델 |
| REASONING | frontier 모델, 높은 effort |
| Response | 어떤 모델, 어떤 프로바이더든 |
- 원클릭 설정. 프록시가 이미 제공하는 모델들을 자동으로 확인해 네 개의 티어를 모두 채워 줘요. 템플릿을 고를 필요가 없어요.
- 클라이언트에는 모델 이름 하나. 게이트웨이가 각 요청을 분류하고 모델을 선택합니다.
- 티어마다 어떤 모델이든, 어떤 프로바이더든. 단일 모델, 무작위 풀, 또는 Thompson-sampled 풀.
- 분류기 선택. 휴리스틱, LLM, TypeSafe System One을 통한 JEV, 키워드 규칙, 또는 커스텀 플러그인.
- 요청마다 절감 보고. 로그와 Cost Optimization에서 all-frontier 기준선 대비 절감액을 보여줘요.
- 에이전트 안전. 프롬프트 캐싱, 컨텍스트 창 상향(escalation), 모달리티 라우팅, 중간 작업 중단 상향, 선택적 세션 고정.
결과
| 결과 | 측정 기준 | 더 읽기 |
|---|---|---|
| JEV: Haiku보다 5.43배 빠른 분류 지연 시간, 레지스트리 가격 분류기 비용 96.12% 하락 | 작성된 합성 케이스 80개, 3회 짝지은 반복, 하나의 고정 루브릭으로 작성 기대 티어와 95.00% vs 73.75% 일치 | JEV 비교 |
| 비용 27% 낮은 Claude Opus-5 해결률 | Terminal-Bench 2.0의 21-task 서브셋, 16/21 모두 해결 | Terminal-Bench |
| Heuristic v2: v1보다 task당 비용 45% 낮게 task 27% 더 해결 | 같은 21-task 서브셋, LLM 분류기 호출 없음 | Heuristic v2 |
| frontier 품질의 87.3%에서 74.5% 저렴 | RouterArena, 8,399건의 등급 매긴 쿼리 | 비용과 품질 |
| 51.1% 절감, 4개월간 $12,249 | 프로덕션 요청 272,876건, 450명 이상의 사용자 | 프로덕션 케이스 스터디 |
| 캐싱만 할 때보다 37%~69% 저렴 | 라이브 게이트웨이 트래픽 포함 5개 데이터셋 | 프롬프트 캐싱 |
| 응답의 88.1%에서 현재 모델과 일치하거나 능가 | 라이브 트래픽에 대한 섀도 평가, 판정된 턴 143개 | 섀도 평가들 |
빠른 시작
- 대시보드: Models + Endpoints → Add Model → Auto Router 탭에서 이름을 입력한 뒤 Configure automatically 를 클릭하거나 템플릿을 선택하세요. 티어를 검토하고, Test Routing을 하고, 저장합니다.
- 에이전트:
curl -fsSL https://docs.litellm.ai/skills/auto-router를 실행하고 지침을 따르라고 하세요. - config.yaml: 티어가 같은 파일의 다른 모델들을 이름으로 가리키는 라우터 항목 하나.
model_list:
- model_name: claude-haiku-4-5
litellm_params:
model: anthropic/claude-haiku-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: smart-router
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: claude-haiku-4-5
MEDIUM: claude-sonnet-5
COMPLEX: claude-opus-5
REASONING: claude-opus-5
classifier_type: heuristic
complexity_router_default_model: claude-sonnet-5
curl -X POST http://localhost:4000/v1/chat/completions \
-H "Authorization: Bearer ***" \
-d '{"model": "smart-router", "messages": [{"role": "user", "content": "What is 2+2?"}]}'
출처: 문서
본문
더 살펴보기
분류에 TypeSafe System One을 사용하려면 classifier_type: jev를 선택하고 jev_classifier_config를 구성하세요. JEV 셋업으로 시작하고 컨텍스트, 폴백, 회계를 검토하세요.
- Admin Setup — 대시보드 프리셋, 에이전트 스킬, config.yaml, 또는 CLI로 Auto Router 만들기
- User Setup —
lite configure로 Claude Code 또는 Codex 연결, Claude Code에서 라이브 세션 절감 확인 - Recommended Configurations — 1M Context, Anthropic, OpenAI, Gemini, Lite 사다리(ladders)를 config.yaml로, 벤치마크 및 프로덕션 구성
- Public Benchmarks — Terminal-Bench 2.0, Heuristic v2, RouterArena, 분류기 컨텍스트, 프로덕션 케이스 스터디, Fusion
- Prompt Caching — 모델 전환에도 캐시를 따뜻하게 유지. 5개 데이터셋에서 측정됨
- Evaluate on Your Traffic — 전환 전 섀도 평가, 전환 후 절감 회계
- Feature History — 어떤 Auto Router 기능이 어떤 릴리스에 들어갔는지, 안정적인 GitHub 릴리스 링크 포함
- Configuration Reference — 모든
complexity_router_config키와 기본값
릴리스 포스트
- Harness-Aware Routing: Claude Code와 Codex 컨텍스트 처리, 암호화된 위임 작업, 분류기 로그
- Mid-Task Stall Escalation: 재시도 루프에 갇힌 요청을 한 티어 올림
- Auto Router v2: 복잡도·의미·어댑티브 라우팅을 위한 라우터 하나
- 1-click 프리셋과 Test Routing
- Savings 탭과 요청별 분류기 비용
- 분류기 컨텍스트와 사용 벤치마크
- 섀도 평가
- 컨텍스트 크기와 모달리티 라우팅