vLLM 시스템 논문 — 쉽고 빠르고 저렴한 LLM 서빙

vLLM 시스템 논문 — 쉽고 빠르고 저렴한 LLM 서빙

vLLM: Easy, Fast and Cheap LLM Serving with PagedAttention 은 vLLM 서빙 엔진 전체를 설명하는 시스템 논문이에요. "Easy"(쉬움), "Fast"(빠름), "Cheap"(저렴함)이라는 제목 그대로, GPU 메모리 사용률을 높여 비용을 낮추는 데 PagedAttention이 핵심 역할을 해요.

시스템 설계

  • PagedAttention 메모리 관리: KV 캐시를 페이지 단위로 관리해, 비연속 메모리와 페이지 공유(블록 코피 트릭) 로 컨텍스트 프리픽스 재사용·병렬 샘플링을 효율화한다.
  • 연속 배칭(continuous batching): 하나의 요청이 끝나면 즉시 다른 요청의 토큰 생성이 시작돼 GPU를 꽉 채운다.
  • 고성능 커널: 프로덕션 CUDA 커널·양자화 등으로 디코딩 단계를 최적화한다.

실용성

단순한 Python API(LLM(...), llm.generate(...))로 추론·서빙·양자화·분산을 모두 다룬다. 그래서 쉽고, PagedAttention 덕에 빠르고, 메모리 효율 덕에 저렴하다는 슬로건이 성립한다.

더 알아보기