vLLM 워커로 LLM 추론 서빙하기

vLLM 워커로 LLM 추론 서빙하기

RunPod Serverless에서 대규모 언어 모델(LLM) 추론 엔드포인트를 자동 확장으로 서빙하려면 vLLM 워커를 쓰면 돼요. 빠른 추론과 자동 스케일링을 함께 제공해서, RunPod Hub에서 바로 배포하거나 runpod-workers/worker-vllm 저장소를 기준으로 커스텀할 수 있어요.

출처: vLLM 워커 개요

vLLM이란?

vLLM은 대규모 언어 모델을 서빙하도록 최적화된 오픈소스 추론 엔진이에요. PagedAttention과 연속 배치(continuous batching) 같은 기법으로 처리량을 극대화하고 지연을 최소화해요.

  • PagedAttention: KV cache를 페이지로 나눠 메모리를 효율적으로 써요. 더 작은 GPU에서도 높은 동시성과 더 큰 모델을 돌릴 수 있게 해 줘요.
  • 연속 배치(Continuous batching): 배치를 기다리는 대신 요청이 도착하는 대로 처리해서 GPU를 바쁘게 유지하고 지연을 줄여요.
  • OpenAI 호환성: OpenAI API의 드롭인 대체재예요. 엔드포인트 URL과 API 키만 바꾸면 그대로 쓸 수 있어요.
  • Hugging Face 통합: Llama, Mistral, Qwen, Gemma, DeepSeek 등 대부분의 모델을 지원해요.
  • 자동 확장: 요청량에 따라 0개에서 여러 개까지 확장하고 초 단위로 과금해요.

배포 옵션

구성(Configuration)

기본 설정만으로 동작하는 모델이 많지만, 일부 모델은 추가 환경 변수가 필요해요(이 값들은 vllm serve 플래그에 매핑돼요). 모델별 요구사항은 모델의 Hugging Face README와 vLLM 문서에서 확인하세요.

더 알아보기 (Learn more)