LiteLLM Load Balancing — 트래픽을 고르게 분산한다

LiteLLM Load Balancing — 트래픽을 고르게 분산한다

라우팅이 '어느 모델로' 보낼지 정한다면, 로드 밸런싱 은 같은 모델·공급자 여러 백엔드에 트래픽을 고르게 나누는 일이에요. LiteLLM Proxy는 이 두 가지를 함께 처리해요.

왜 필요한가요

한 공급자의 rate limit(요청 한도)를 넘지 않으면서 여러 백엔드의 자원을 균등하게 쓰고 싶을 때 필요해요. 예컨대 같은 OpenAI 배포본 하나 대신 여러 배포를 번갈아 호출하면 처리량이 올라가요.

핵심 동작

  • 헬스체크: 비정상 백엔드를 감지해 트래픽에서 제외해요.
  • 쿼터 인지 분산: rate limit을 고려해 요청을 배분해 429 오류를 줄여요.
  • 런타임 라우팅: 요청마다 최적의 백엔드를 동적으로 선택해요.

실전 설정

LiteLLM Proxy 설정 파일에서 router_settingsmodel_list 로 여러 업스트림을 정의하고, 각각의 가중치(weight)나 우선순위를 줄 수 있어요. 실패하면 자동으로 다음 백엔드로 넘어가요.

더 알아보기