Anyscale — continuous batching으로 23배 처리량
Anyscale — continuous batching으로 23배 처리량
Anyscale의 이 글은 Continuous Batching 이 LLM 추론 처리량을 어떻게 23배까지 높이고 p50 지연을 줄이는지 설명하는 대표 자료예요. 기술 적용 배경과 기존 정적 배칭의 한계를 풀어요.
정적 배칭의 문제
- 기존에는 요청을 배치(chunk) 단위로 묶어 배치 전체가 끝나야 다음 배치가 시작됐어요.
- 가장 느린 요청 하나가 배치 전체를 붙잡아 GPU 유휴가 생겼어요.
연속 배칭 해결
- 요청 단위로 처리해, 한 요청이 끝나는 즉시 새 요청의 토큰 생성을 배치에 끼워 넣어요.
- Constant batching으로 GPU 활용률을 높여 높은 처리량과 낮은 지연을 동시에 얻어요.
- vLLM이 이 개념을 핵심으로 채택해 널리 쓰이게 됐어요.
시사점
- 메모리 관리(PagedAttention 등)와 결합해 달성한 서빙 성과의 핵심 축이에요.
- LLM 서빙 엔진의 기본 설계 사상이 됐어요.