vLLM — PagedAttention을 품은 LLM 서빙 엔진

vLLM — PagedAttention을 품은 LLM 서빙 엔진

vLLM 은 PagedAttention으로 유명해진 오픈소스 LLM 추론·서빙 엔진이에요. 단일 GPU부터 수천 GPU의 분산 배포까지 확장하며, OpenAI 호환 서버를 포함해 다양한 배포 방식을 제공해요.

주요 특징

  • PagedAttention: KV 캐시를 페이지로 관리해 파편화를 없애고 높은 배칭 효율을 낸다.
  • 연속 배칭·프리픽스 캐싱: 요청 간 컨텍스트 프리픽스를 재사용해 처리량을 높인다.
  • 다양한 모델·하드웨어: 수백 개 공개 모델과 NVIDIA/AMD/인텔 등 여러 하드웨어를 지원한다.
  • 호환성: OpenAI-compatible API 서버, 다양한 양자화 백엔드, 분산 텐서 병렬을 지원한다.

사용

from vllm import LLM, SamplingParams
llm = LLM(model="meta-llama/Llama-3.1-8B-Instruct")
out = llm.generate("인공지능이란?", SamplingParams(temperature=0.7))

프로덕션에는 vllm serve <model> 로 OpenAI 호환 엔드포인트를 띄울 수 있다.

더 알아보기