Auto Router [Add-on]

Auto Router [Add-on]

조기 액세스를 받아 LiteLLM 팀과 직접 작업하고, 프로덕션 트래픽으로 로드맵에 영향을 주세요.

Design Partner 신청하기

이미 테스트 중이신가요? discussion #32168에서 결과를 공유해 주세요.

추론 요청 모델: any-name-you-pick

분류기 선택
SIMPLE 가장 작고 저렴한 모델
MEDIUM 중간 크기 모델
COMPLEX frontier 모델
REASONING frontier 모델, 높은 effort
Response 어떤 모델, 어떤 프로바이더든
  • 원클릭 설정. 프록시가 이미 제공하는 모델들을 자동으로 확인해 네 개의 티어를 모두 채워 줘요. 템플릿을 고를 필요가 없어요.
  • 클라이언트에는 모델 이름 하나. 게이트웨이가 각 요청을 분류하고 모델을 선택합니다.
  • 티어마다 어떤 모델이든, 어떤 프로바이더든. 단일 모델, 무작위 풀, 또는 Thompson-sampled 풀.
  • 분류기 선택. 휴리스틱, LLM, TypeSafe System One을 통한 JEV, 키워드 규칙, 또는 커스텀 플러그인.
  • 요청마다 절감 보고. 로그와 Cost Optimization에서 all-frontier 기준선 대비 절감액을 보여줘요.
  • 에이전트 안전. 프롬프트 캐싱, 컨텍스트 창 상향(escalation), 모달리티 라우팅, 중간 작업 중단 상향, 선택적 세션 고정.

결과

결과 측정 기준 더 읽기
JEV: Haiku보다 5.43배 빠른 분류 지연 시간, 레지스트리 가격 분류기 비용 96.12% 하락 작성된 합성 케이스 80개, 3회 짝지은 반복, 하나의 고정 루브릭으로 작성 기대 티어와 95.00% vs 73.75% 일치 JEV 비교
비용 27% 낮은 Claude Opus-5 해결률 Terminal-Bench 2.0의 21-task 서브셋, 16/21 모두 해결 Terminal-Bench
Heuristic v2: v1보다 task당 비용 45% 낮게 task 27% 더 해결 같은 21-task 서브셋, LLM 분류기 호출 없음 Heuristic v2
frontier 품질의 87.3%에서 74.5% 저렴 RouterArena, 8,399건의 등급 매긴 쿼리 비용과 품질
51.1% 절감, 4개월간 $12,249 프로덕션 요청 272,876건, 450명 이상의 사용자 프로덕션 케이스 스터디
캐싱만 할 때보다 37%~69% 저렴 라이브 게이트웨이 트래픽 포함 5개 데이터셋 프롬프트 캐싱
응답의 88.1%에서 현재 모델과 일치하거나 능가 라이브 트래픽에 대한 섀도 평가, 판정된 턴 143개 섀도 평가들

빠른 시작

  • 대시보드: Models + Endpoints → Add Model → Auto Router 탭에서 이름을 입력한 뒤 Configure automatically 를 클릭하거나 템플릿을 선택하세요. 티어를 검토하고, Test Routing을 하고, 저장합니다.
  • 에이전트: curl -fsSL https://docs.litellm.ai/skills/auto-router를 실행하고 지침을 따르라고 하세요.
  • config.yaml: 티어가 같은 파일의 다른 모델들을 이름으로 가리키는 라우터 항목 하나.
model_list:
  - model_name: claude-haiku-4-5
    litellm_params:
      model: anthropic/claude-haiku-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: claude-sonnet-5
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: claude-opus-5
    litellm_params:
      model: anthropic/claude-opus-5
      api_key: os.environ/ANTHROPIC_API_KEY

  - model_name: smart-router
    litellm_params:
      model: auto_router/complexity_router
      complexity_router_config:
        tiers:
          SIMPLE:    claude-haiku-4-5
          MEDIUM:    claude-sonnet-5
          COMPLEX:   claude-opus-5
          REASONING: claude-opus-5
        classifier_type: heuristic
      complexity_router_default_model: claude-sonnet-5
curl -X POST http://localhost:4000/v1/chat/completions \
  -H "Authorization: Bearer ***" \
  -d '{"model": "smart-router", "messages": [{"role": "user", "content": "What is 2+2?"}]}'

출처: 문서

본문

더 살펴보기

분류에 TypeSafe System One을 사용하려면 classifier_type: jev를 선택하고 jev_classifier_config를 구성하세요. JEV 셋업으로 시작하고 컨텍스트, 폴백, 회계를 검토하세요.

  • Admin Setup — 대시보드 프리셋, 에이전트 스킬, config.yaml, 또는 CLI로 Auto Router 만들기
  • User Setuplite configure로 Claude Code 또는 Codex 연결, Claude Code에서 라이브 세션 절감 확인
  • Recommended Configurations — 1M Context, Anthropic, OpenAI, Gemini, Lite 사다리(ladders)를 config.yaml로, 벤치마크 및 프로덕션 구성
  • Public Benchmarks — Terminal-Bench 2.0, Heuristic v2, RouterArena, 분류기 컨텍스트, 프로덕션 케이스 스터디, Fusion
  • Prompt Caching — 모델 전환에도 캐시를 따뜻하게 유지. 5개 데이터셋에서 측정됨
  • Evaluate on Your Traffic — 전환 전 섀도 평가, 전환 후 절감 회계
  • Feature History — 어떤 Auto Router 기능이 어떤 릴리스에 들어갔는지, 안정적인 GitHub 릴리스 링크 포함
  • Configuration Reference — 모든 complexity_router_config 키와 기본값

릴리스 포스트

  • Harness-Aware Routing: Claude Code와 Codex 컨텍스트 처리, 암호화된 위임 작업, 분류기 로그
  • Mid-Task Stall Escalation: 재시도 루프에 갇힌 요청을 한 티어 올림
  • Auto Router v2: 복잡도·의미·어댑티브 라우팅을 위한 라우터 하나
  • 1-click 프리셋과 Test Routing
  • Savings 탭과 요청별 분류기 비용
  • 분류기 컨텍스트와 사용 벤치마크
  • 섀도 평가
  • 컨텍스트 크기와 모달리티 라우팅

더 알아보기 (Learn more)