LiteLLM v1.71.1 벤치마크

LiteLLM v1.71.1 벤치마크 (Benchmarks)

LiteLLM v1.71.1이 기존 httpx 전송을 aiohttp 전송으로 교체하면서 성능이 크게 개선됐어요. RPS는 약 4.5배, 응답 지연 시간은 평균 97% 감소한 결과를 보여주는 문서랍니다.

출처: 문서

본문

개요 (Overview)

이 문서는 LiteLLM의 v1.71.1과 이전 litellm 버전을 비교한 성능 벤치마크 결과를 보여줘요.

관련 PR: #11097

테스트 방법론 (Testing Methodology)

부하 테스트는 다음 파라미터로 진행됐어요:

  • 요청 속도(Request Rate): 200 RPS (초당 요청 수)
  • 사용자 램프업(User Ramp Up): 동시 사용자 200명
  • 전송 방식 비교(Transport Comparison): httpx(기존) vs aiohttp(새 구현)
  • litellm 파드/인스턴스 수: 1
  • 머신 사양(Machine Specs): 2 vCPU, 4GB RAM
  • LiteLLM 설정: 가짜(fake) openai 엔드포인트를 대상으로 테스트. 환경 변수에 USE_AIOHTTP_TRANSPORT="True" 설정. 이 기능 플래그가 aiohttp 전송을 활성화해요.

벤치마크 결과 (Benchmark Results)

메트릭 httpx (기존) aiohttp (LiteLLM v1.71.1) 개선 계산식
RPS 50.2 224 +346% ✅ (224 - 50.2) / 50.2 × 100 = 346%
중앙값 지연 시간 (Median Latency) 2,500ms 74ms -97% ✅ (74 - 2500) / 2500 × 100 = -97%
95백분위 (95th Percentile) 5,600ms 250ms -96% ✅ (250 - 5600) / 5600 × 100 = -96%
99백분위 (99th Percentile) 6,200ms 330ms -95% ✅ (330 - 6200) / 6200 × 100 = -95%

핵심 개선 사항 (Key Improvements)

  • 초당 요청 수 4.5배 증가 (50.2 → 224 RPS)
  • 중앙값 응답 시간 97% 감소 (2.5초 → 74ms)
  • 95백분위 지연 시간 96% 감소 (5.6초 → 250ms)
  • 99백분위 지연 시간 95% 감소 (6.2초 → 330ms)

더 알아보기 (Learn more)