LiteLLM 개요: 100여 개 LLM을 하나의 인터페이스로
LiteLLM 개요: 100여 개 LLM을 하나의 인터페이스로
LiteLLM은 오픈소스 AI 게이트웨이(LLM 게이트웨이)예요. OpenAI·Anthropic·Gemini·Bedrock·Azure 등 100여 개가 넘는 LLM 프로바이더를 OpenAI 입출력 형식 하나로 통일해서 호출할 수 있게 해주는 도구죠. 각 모델마다 SDK도 다르고 인증 방식도 다르고 에러 형식도 다른데, LiteLLM이 그 복잡함을 대신 정리해 준다고 보면 돼요.
왜 LiteLLM을 쓰나요
여러 LLM 프로바이더를 직접 붙이다 보면 골치 아픈 일이 금방 쌓여요. 프로바이더마다 요청 포맷이 다르고(chat completions, responses, embeddings, images, audio, batches...), 인증 패턴도 제각각이며, 에러 타입조차 다릅니다. LiteLLM은 이런 마찰을 없애 줍니다.
- 프로바이더별 엔드포인트(
/chat/completions,/responses,/embeddings,/images,/audio,/batches등)로 입력을 자동 번역해 전달해요. - 어떤 프로바이더를 쓰든 동일한 응답 형식을 돌려줍니다.
- Azure/OpenAI 등 여러 배포에 걸친 재시도·폴백(fallback) 로직을 제공해요(Router).
- 프로젝트별로 비용(spend) 추적과 예산(budget) 설정을 지원합니다.
Python SDK와 Proxy Server, 어떻게 고를까
LiteLLM을 쓰는 방법은 크게 둘로 나뉘어요. 둘 다 여러 LLM(100여 개)에 접근하는 통일된 인터페이스를 주지만, 쓰임새가 달라요.
| LiteLLM Proxy Server | LiteLLM Python SDK | |
|---|---|---|
| 용도 | 여러 LLM을 제공하는 중앙 서비스(LLM 게이트웨이) | 코드 안에서 LiteLLM을 직접 사용 |
| 주 사용자 | Gen AI 플랫폼/ML 플랫폼 팀 | LLM 프로젝트를 만드는 개발자 |
| 핵심 기능 | • 인증·권한을 갖춘 중앙 API 게이트웨이 • 프로젝트/사용자별 멀티테넌트 비용 추적 • 프로젝트별 로깅·가드레일·캐싱 커스터마이징 • 접근 제어용 가상 키(virtual keys) • 모니터링·관리용 관리자 대시보드 |
• 코드베이스에 바로 넣는 파이썬 라이브러리 • 여러 배포 간 재시도·폴백을 처리하는 Router • 애플리케이션 레벨 로드밸런싱·비용 추적 • OpenAI 호환 에러 기반 예외 처리 • 관측성 콜백(Langfuse, MLflow 등) |
Python SDK 기본 사용법
설치 후 환경변수에 API 키만 설정하면 completion() 한 함수로 바로 호출할 수 있어요.
uv add litellm
from litellm import completion
import os
# 환경변수로 API 키 설정
os.environ["OPENAI_API_KEY"] = "your-api-key"
response = completion(
model="openai/gpt-5",
messages=[{"content": "Hello, how are you?", "role": "user"}]
)
모델 이름을 openai/gpt-5처럼 <프로바이더>/<모델> 형태로 쓰는 점이 특징이에요. 이 프리픽스 덕분에 같은 completion() 함수로 OpenAI든 Anthropic이든 호출할 수 있고, 응답은 언제나 OpenAI 채팅 컴플리션 형식으로 옵니다.
고급 API와 기능
- Responses API — 추론(reasoning) 콘텐츠를 지원하는 GPT-5, o3 같은 최신 모델은
litellm.responses()를 써요.reasoning_effort같은 파라미터로 추론 수준을 조절할 수 있어요. - 스트리밍 —
completion(..., stream=True)로 스트리밍 응답을 받을 수 있어요. - 예외 처리 — LiteLLM은 모든 프로바이더의 예외를 OpenAI 예외로 매핑해요. 그래서 기존에 OpenAI용으로 짜 둔 에러 핸들링을 그대로 재사용할 수 있죠.
- 관측성(observability) — Langfuse, MLflow, Lunary, Helicone, Slack 등으로 LLM 입출력을 보내는 콜백을 제공합니다.
더 알아보기
- LiteLLM Proxy Server(하나의 OpenAI 호환 API로 100여 개 LLM을 중계하는 서버)는 프록시 요청 수명 문서에서 다뤄요.
- 지원하는 프로바이더의 종류와 분류는 지원 Provider 개요에서 확인하세요.
- 로드밸런싱·폴백·재시도 개념은 Router 문서에서 살펴볼 수 있어요.