LiteLLM v1.71.1 벤치마크
LiteLLM v1.71.1 벤치마크 (Benchmarks)
LiteLLM v1.71.1이 기존 httpx 전송을 aiohttp 전송으로 교체하면서 성능이 크게 개선됐어요. RPS는 약 4.5배, 응답 지연 시간은 평균 97% 감소한 결과를 보여주는 문서랍니다.
출처: 문서
본문
개요 (Overview)
이 문서는 LiteLLM의 v1.71.1과 이전 litellm 버전을 비교한 성능 벤치마크 결과를 보여줘요.
관련 PR: #11097
테스트 방법론 (Testing Methodology)
부하 테스트는 다음 파라미터로 진행됐어요:
- 요청 속도(Request Rate): 200 RPS (초당 요청 수)
- 사용자 램프업(User Ramp Up): 동시 사용자 200명
- 전송 방식 비교(Transport Comparison): httpx(기존) vs aiohttp(새 구현)
- litellm 파드/인스턴스 수: 1
- 머신 사양(Machine Specs): 2 vCPU, 4GB RAM
- LiteLLM 설정: 가짜(fake) openai 엔드포인트를 대상으로 테스트. 환경 변수에
USE_AIOHTTP_TRANSPORT="True"설정. 이 기능 플래그가 aiohttp 전송을 활성화해요.
벤치마크 결과 (Benchmark Results)
| 메트릭 | httpx (기존) | aiohttp (LiteLLM v1.71.1) | 개선 | 계산식 |
|---|---|---|---|---|
| RPS | 50.2 | 224 | +346% ✅ | (224 - 50.2) / 50.2 × 100 = 346% |
| 중앙값 지연 시간 (Median Latency) | 2,500ms | 74ms | -97% ✅ | (74 - 2500) / 2500 × 100 = -97% |
| 95백분위 (95th Percentile) | 5,600ms | 250ms | -96% ✅ | (250 - 5600) / 5600 × 100 = -96% |
| 99백분위 (99th Percentile) | 6,200ms | 330ms | -95% ✅ | (330 - 6200) / 6200 × 100 = -95% |
핵심 개선 사항 (Key Improvements)
- 초당 요청 수 4.5배 증가 (50.2 → 224 RPS)
- 중앙값 응답 시간 97% 감소 (2.5초 → 74ms)
- 95백분위 지연 시간 96% 감소 (5.6초 → 250ms)
- 99백분위 지연 시간 95% 감소 (6.2초 → 330ms)