LiteLLM 프록시가 노출하는 지원 엔드포인트 개요

LiteLLM 프록시가 노출하는 지원 엔드포인트 개요

LiteLLM 프록시가 "OpenAI 호환 게이트웨이"라는 건, 클라이언트 입장에서 OpenAPI 스펙을 그대로 쓰면서도 그 뒤의 온갖 모델·도구·프로토콜에 요청을 넘겨주기 때문에 가능한 일이에요. 이 페이지는 그 프록시가 어떤 엔드포인트들을 노출하는지 한눈에 보여주는 지도입니다. 텍스트 생성만 있는 게 아니라 임베딩, 이미지, 오디오, 벡터 스토어, MCP, 에이전트, 배치, 파인튜닝까지 폭이 훨씬 넓어요.

핵심만 먼저 짚자면, 항상 쓰게 될 중심축은 **채팅 완성(/chat/completions)과 응답(/responses)**이고, 그 주변으로 입력(completion)과 임베딩, 그리고 보조 모달리티들이 붙어 있습니다.

출처: 공식문서 — Supported Endpoints

채팅과 응답: 게이트웨이의 중심축

/chat/completions 가 가장 기본적인 채팅 인터페이스예요. 텍스트와 멀티모달 입력, 스트리밍, 함수 호출까지 OpenAI 규격 그대로 다룹니다. /responses 는 OpenAI의 Responses API 스펙을 따르는 엔드포인트로, 상태를 갖는 대화 흐름을 더 자연스럽게 설계할 수 있게 해줘요. Anthropic 규격을 그대로 쓰고 싶다면 /v1/messages 계열도 있습니다.

여기서 포인트는, 이 엔드포인트들의 스펙은 고정인데 뒤에서 어떤 프로바이더로 갈지는 model 파라미터가 결정한다는 거예요. 그래서 앱은 한 가지 규격만 배워두면 되고, 모델만 바꿔 끼우면 됩니다 — 이게 LiteLLM의 "한 번 배우면 어디서든" 경험의 중심이에요.

텍스트·임베딩·토큰

  • /completions — 레거시 텍스트 완성 스타일의 인터페이스예요.
  • /embeddings — 임베딩 모델 호출. RAG의 첫 관문이에요.
  • Token Counting / /v1/messages/count_tokens — 프롬프트 토큰 수를 실제 호출 전에 미리 셉니다. 비용·컨텍스트 관리를 위해 자주 쓰여요.

이미지·오디오·비디오·OCR

  • /images/generations, /images/edits, /images/variations — 이미지 생성과 편집(단일·다중), 변형까지 OpenAI 이미지 API를 매핑해요.
  • /audio/speech, /audio/transcriptions — 텍스트→음성 합성과 음성→텍스트 전사.
  • /videos, /interactions — 비디오 생성과 실시간 상호작용 모델.
  • /ocr — 문서·이미지에서 텍스트를 뽑는 OCR.
  • /rerank — Cohere 스타일 요청/응답을 따르는 리랭킹.

벡터·검색·메모리·파일

  • /vector_stores, /search — 벡터 스토어 CRUD와 검색. 다양한 벡터 DB를 뒤에 붙일 수 있어요.
  • /memory — 사용자/팀 범위의 메모리 항목을 저장·조회하는 CRUD. 대화 컨텍스트, 에이전트 메모리, 팀 플레이북처럼 키-값 데이터를 유지하는 데 씁니다.
  • /files — 파일 업로드·관리. 파인튜닝과 컨테이너 실행의 입력 재료로 쓰여요.

모델 실행·평가·가드레일

  • /fine_tuning — 파인튜닝 작업 생성·관리.
  • /evals — OpenAI Evals API를 지원해서, 정의한 평가 기준 대비 모델 성능을 측정하는 평가를 만들고 돌릴 수 있어요.
  • /moderations — 콘텐츠 모더레이션.
  • /guardrails/apply_guardrail — LiteLLM 인스턴스에 설정된 가드레일을 직접 호출. 가드레일을 단독으로 호출해야 하는 서비스에 유용해요.
  • /containers, /containers/files — 코드 실행용 격리 컨테이너(코드 인터프리터)를 관리하고 그 안에서 생성된 파일을 다룹니다.

에이전트·프로토콜 게이트웨이

여기가 LiteLLM이 단순 "LLM 라우터"를 넘어선 부분이에요. /mcp 는 MCP(Model Context Protocol) 서버를 등록·호출하는 경로이고, /a2a, /v1beta/agents, /v1/agents 는 A2A 에이전트 게이트웨이 경로예요. Pass-through 엔드포인트로는 Anthropic SDK 등 특정 공급자의 원래 스펙을 그대로 통과시키는 경로들도 제공합니다. 이들은 "모델 호출"이 아니라 "도구·에이전트 호출"이라는 점에서 게이트웨이의 지평을 넓혀주는 축이에요.

실시간

/realtime 은 오디오 기반 실시간 대화 API를 Azure·OpenAI·xAI 등에 로드밸런싱할 수 있게 해 주고, WebRTC(/realtime - WebRTC Support)로는 브라우저/모바일 클라이언트가 직접 스트리밍 요청을 보낼 수 있게 해요. 인증은 LiteLLM이 처리하고 오디오는 그대로 OpenAI/Azure로 흐릅니다.

각 엔드포인트의 세부 설정은 목록에 연결된 전용 페이지에서 이어집니다. 처음이라면 채팅 완성부터 시작해서 필요할 때마다 임베딩·응답·실시간 등을 골라 들어가면 돼요.

더 알아보기