권장 구성
권장 구성 (Recommended Configurations)
대시보드의 Auto Router 템플릿과 일치하는 권장 사다리(ladders)예요. 모든 티어는 같은 파일의 model_name으로 존재해야 하며, 프로바이더 접두사나 자격 증명을 자체 배포로 바꾸면 라우터 항목은 그대로 유지돼요.
| 사다리 | SIMPLE | MEDIUM | COMPLEX | REASONING | 분류기 |
|---|---|---|---|---|---|
| 1M Context | gpt-5.6-luna |
gpt-5.6-terra |
gpt-5.6-sol |
claude-opus-5, high effort |
heuristic v2 |
| Anthropic Family | claude-haiku-4-5 |
claude-sonnet-5 |
claude-opus-5 |
claude-opus-5, high effort |
heuristic |
| OpenAI Family | gpt-5.6-luna |
gpt-5.6-terra |
gpt-5.6-sol |
gpt-5.6-sol, xhigh effort |
heuristic |
| Gemini Family | gemini-2.5-flash-lite |
gemini-3.1-flash-lite |
gemini-3.7-flash |
gemini-3.1-pro-preview |
heuristic |
| Lite | deepseek-v4-flash |
muse-spark-1.2, xhigh |
kimi-k3, max |
claude-opus-5 |
LLM, agentic rubric |
| Benchmark config | claude-haiku-4-5 |
claude-sonnet-5 |
claude-opus-5 |
claude-opus-5 |
LLM, gpt-5.4-mini |
| Production config | claude-haiku-4-5 |
claude-haiku-4-5 |
claude-sonnet-5 |
claude-opus-5 |
heuristic |
사다리 선택
- 단일 계열 — 클라이언트가 프로바이더별 동작(Anthropic 캐시 제어, OpenAI reasoning params)에 의존할 때. 모든 티어가 하나의 API 표면에 유지됩니다.
- Lite — 비용이 프로바이더 일관성보다 중요하고 트래픽이 에이전틱일 때. 혼합 프로바이더, agentic 루브릭을 가진 LLM 분류기.
- 1M Context — 긴 프롬프트용. Luna, Terra, Sol, 그다음 high effort의 Opus 5, heuristic v2 분류기.
- 같은 모델, 더 높은 effort로 최상위 rung — 토큰당 요율이 아니라 출력 토큰이 더 들죠. 패턴: effort 사다리.
- 모든 사다리는
session_affinity를 끄고(기본; 프롬프트 캐싱 참고)escalation_keywords: ["LITELLM ESCALATE"]를 설정합니다. 정확한 구문이 나타나면 요청을 한 티어 올려요. 매칭은 대소문자 구분.
출처: 문서
본문
Anthropic Family
Haiku, Sonnet, Opus, 그다음 high reasoning effort의 Opus.
model_list:
- model_name: claude-haiku-4-5
litellm_params:
model: anthropic/claude-haiku-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-opus-5-high
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
reasoning_effort: high
- model_name: claude-auto
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: claude-haiku-4-5
MEDIUM: claude-sonnet-5
COMPLEX: claude-opus-5
REASONING: claude-opus-5-high
classifier_type: heuristic
escalation_keywords: ["LITELLM ESCALATE"]
session_affinity: false
complexity_router_default_model: claude-sonnet-5
Claude Code나 Claude Desktop이 발견해야 한다면 라우터 이름에 claude를 유지하세요. Admin Setup 참고.
OpenAI Family
Luna, Terra, Sol, 그다음 xhigh reasoning effort의 Sol.
model_list:
- model_name: gpt-5.6-luna
litellm_params:
model: openai/gpt-5.6-luna
api_key: os.environ/OPENAI_API_KEY
- model_name: gpt-5.6-terra
litellm_params:
model: openai/gpt-5.6-terra
api_key: os.environ/OPENAI_API_KEY
- model_name: gpt-5.6-sol
litellm_params:
model: openai/gpt-5.6-sol
api_key: os.environ/OPENAI_API_KEY
- model_name: gpt-5.6-sol-xhigh
litellm_params:
model: openai/gpt-5.6-sol
api_key: os.environ/OPENAI_API_KEY
reasoning_effort: xhigh
- model_name: gpt-auto
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: gpt-5.6-luna
MEDIUM: gpt-5.6-terra
COMPLEX: gpt-5.6-sol
REASONING: gpt-5.6-sol-xhigh
classifier_type: heuristic
escalation_keywords: ["LITELLM ESCALATE"]
session_affinity: false
complexity_router_default_model: gpt-5.6-terra
Gemini Family
Flash Lite 2.5, Flash Lite 3.1, Flash 3.7, 그다음 Pro 3.1.
model_list:
- model_name: gemini-2.5-flash-lite
litellm_params:
model: gemini/gemini-2.5-flash-lite
api_key: os.environ/GEMINI_API_KEY
- model_name: gemini-3.1-flash-lite
litellm_params:
model: gemini/gemini-3.1-flash-lite
api_key: os.environ/GEMINI_API_KEY
- model_name: gemini-3.7-flash
litellm_params:
model: gemini/gemini-3.7-flash
api_key: os.environ/GEMINI_API_KEY
- model_name: gemini-3.1-pro-preview
litellm_params:
model: gemini/gemini-3.1-pro-preview
api_key: os.environ/GEMINI_API_KEY
- model_name: gemini-auto
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: gemini-2.5-flash-lite
MEDIUM: gemini-3.1-flash-lite
COMPLEX: gemini-3.7-flash
REASONING: gemini-3.1-pro-preview
classifier_type: heuristic
escalation_keywords: ["LITELLM ESCALATE"]
session_affinity: false
complexity_router_default_model: gemini-3.1-flash-lite
Lite
교차 프로바이더, 비용 중심. DeepSeek V4 Flash는 agentic 루브릭과 제로 턴 컨텍스트 창으로 LLM 분류기도 겸합니다.
model_list:
- model_name: deepseek-v4-flash
litellm_params:
model: deepseek/deepseek-v4-flash
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: muse-spark-1.2-xhigh
litellm_params:
model: meta/muse-spark-1.2
api_key: os.environ/META_API_KEY
reasoning_effort: xhigh
- model_name: kimi-k3-max
litellm_params:
model: moonshot/kimi-k3
api_key: os.environ/MOONSHOT_API_KEY
reasoning_effort: max
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: lite-router
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: deepseek-v4-flash
MEDIUM: muse-spark-1.2-xhigh
COMPLEX: kimi-k3-max
REASONING: claude-opus-5
classifier_type: llm
classifier_llm_config:
model: deepseek-v4-flash
timeout_ms: 3000
classification_rubric: agentic
classifier_context_window_size: 0
escalation_keywords: ["LITELLM ESCALATE"]
session_affinity: false
complexity_router_default_model: muse-spark-1.2-xhigh
1M Context
Luna, Terra, Sol, 그다음 high reasoning effort의 Opus 5. heuristic v2 분류기를 사용하므로 분류가 LLM 호출을 추가하지 않아요.
GPT 티어는 최대 922K 입력 토큰을, Opus 5는 1M을 허용합니다. 라우터는 과도하게 큰 프롬프트를 용량이 있는 가장 낮은 더 높은 티어로 옮겨요. 컨텍스트 창 상향 참고.
model_list:
- model_name: gpt-5.6-luna
litellm_params:
model: openai/gpt-5.6-luna
api_key: os.environ/OPENAI_API_KEY
- model_name: gpt-5.6-terra
litellm_params:
model: openai/gpt-5.6-terra
api_key: os.environ/OPENAI_API_KEY
- model_name: gpt-5.6-sol
litellm_params:
model: openai/gpt-5.6-sol
api_key: os.environ/OPENAI_API_KEY
- model_name: claude-opus-5-high
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
reasoning_effort: high
- model_name: 1m-auto
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: gpt-5.6-luna
MEDIUM: gpt-5.6-terra
COMPLEX: gpt-5.6-sol
REASONING: claude-opus-5-high
classifier_type: heuristic_v2
escalation_keywords: ["LITELLM ESCALATE"]
session_affinity: false
complexity_router_default_model: gpt-5.6-terra
벤치마크 구성
- Terminal-Bench: Opus-5 해결률을 27% 낮은 비용으로 — 이 구성,
gpt-5.4-mini분류기, 현재 메시지만 읽음. - 비용과 품질 및 프롬프트 캐싱: 같은 티어, 휴리스틱 분류기.
model_list:
- model_name: claude-haiku-4-5
litellm_params:
model: anthropic/claude-haiku-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: gpt-5.4-mini
litellm_params:
model: openai/gpt-5.4-mini
api_key: os.environ/OPENAI_API_KEY
- model_name: smart-router
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: claude-haiku-4-5
MEDIUM: claude-sonnet-5
COMPLEX: claude-opus-5
REASONING: claude-opus-5
classifier_type: llm
classifier_llm_config:
model: gpt-5.4-mini
classifier_context_window_size: 0
complexity_router_default_model: claude-sonnet-5
분류기 컨텍스트 창은 자체 트래픽을 위해 다시 볼 노브이에요:
- Terminal-Bench: 마지막 3개 사용자 메시지가 해결률을 66.7%에서 76.2%로 올리고 비용은 44%. assistant 답변은 둘 다 나쁘게 만들었음.
- 채팅 트래픽(v1.97 측정): 이전 턴이 후속 일치를 14%에서 78%로 올림.
- 출시 기본값: 사용자 턴 3개, assistant 턴 없음.
프로덕션 구성
- 51.1% 절감을 보고한 프로덕션 케이스 스터디.
- Haiku가 SIMPLE과 MEDIUM 모두를 제공하고, Opus는 REASONING 전용.
- 요청의 95%가 flagship 티어에 도달하지 않음.
model_list:
- model_name: claude-haiku-4-5
litellm_params:
model: anthropic/claude-haiku-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-auto-latest
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: claude-haiku-4-5
MEDIUM: claude-haiku-4-5
COMPLEX: claude-sonnet-5
REASONING: claude-opus-5
complexity_router_default_model: claude-haiku-4-5
로드 밸런싱이 있는 코딩 에이전트
- 뒤에 배포가 두 개 이상 있는 티어용(예: 같은 Claude 모델을 Anthropic과 Bedrock에서).
session_affinity는 세션에 티어를 고정하고,deployment_affinity는prompt_caching사전 호출 검사와 함께 캐시를 보관한 배포를 고정합니다.- 둘 다 에이전트 트래픽에서 중요합니다. 세부: Session affinity.
model_list:
- model_name: claude-haiku-4-5
litellm_params:
model: anthropic/claude-haiku-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-sonnet-5
litellm_params:
model: bedrock/us.anthropic.claude-sonnet-5
aws_region_name: us-east-1
- model_name: claude-opus-5
litellm_params:
model: anthropic/claude-opus-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: claude-auto
litellm_params:
model: auto_router/complexity_router
cache_control_injection_points:
- location: message
role: system
complexity_router_config:
tiers:
SIMPLE: claude-haiku-4-5
MEDIUM: claude-sonnet-5
COMPLEX: claude-sonnet-5
REASONING: claude-opus-5
session_affinity: true
session_affinity_ttl_seconds: 3600
complexity_router_default_model: claude-sonnet-5
router_settings:
optional_pre_call_checks: ["deployment_affinity", "session_affinity", "prompt_caching"]
deployment_affinity_ttl_seconds: 3600