vLLM — 고성능 LLM 추론 엔진

vLLM — 고성능 LLM 추론 엔진

vLLM은 대규모 언어 모델(LLM)을 빠르고 쉽게 서빙하기 위해 만들어진 오픈소스 추론 엔진(UC Berkeley의 LMSYS에서 시작)이에요. 최첨단 서빙 기술인 PagedAttention 덕분에 메모리를 효율적으로 쓰면서도 높은 처리량을 냅니다. 파인튜닝된 오픈모델을 그대로 올려서 OpenAI 호환 API로 띄우는 일이 아주 간단해져요.

출처: https://docs.vllm.ai/en/latest/

vLLM이 왜 자주 쓰이는지를 한마디로 정리하면, 버추얼 메모리처럼 KV 캐시를 페이지 단위로 잘게 쪼개 관리한다는 점이에요. 덕분에 동시 요청이 많아도 GPU 메모리가 낭비되지 않고, 프리필(prefill) 계산을 공유해서 반복 질문도 빨라집니다. 아래 페이지에서 실제 사용법을 하나씩 살펴볼게요.