vLLM 시작하기

vLLM 시작하기

vLLM은 대규모 언어 모델(LLM)을 고속으로 추론·서빙하기 위한 오픈소스 라이브러리예요. 파이썬에서 모델을 직접 불러 쓰는 오프라인 방식과, OpenAI 호환 HTTP 서버로 띄우는 온라인 서빙 방식을 모두 지원해요. 그래서 "모델 하나로 연구부터 프로덕션 서빙까지" 이어 쓰는 데 강점이 있어요.

출처: https://docs.vllm.ai/

두 가지 사용 경로

vLLM은 크게 두 흐름으로 나눠서 써요.

  • 오프라인(Offline) 추론: 내 코드 안에서 vLLM의 LLM 클래스로 모델을 불러 직접 추론해요. 배치 처리나 파이썬 파이프라인에 자연스럽게 들어가요.
  • 온라인(Online) 서빙: vllm serve 명령으로 OpenAI 호환 HTTP 서버를 띄워, HTTP 클라이언트가 언어를 가리지 않고 모델을 호출하게 해요.

왜 빠른가요

vLLM은 연속 배치(continuous batching), 페이지드 어텐션(PagedAttention) 같은 기술로 GPU 활용을 높여요. 같은 GPU로 더 많은 요청을 처리할 수 있어서, 토큰 당 비용이 줄어드는 게 실제 체감 포인트예요.

OpenAI 호환 서버

vllm serve로 띄운 서버는 OpenAI의 Completions API와 Chat API를 구현해요. 그래서 익숙한 OpenAI 파이썬 클라이언트로 바로 호출할 수 있어요.

vllm serve NousResearch/Meta-Llama-3-8B-Instruct \
  --dtype auto \
  --api-key token-abc123

더 알아보기

  • 내 코드에서 쓰는 법은 «오프라인 추론하기»를 보세요.
  • 서버를 띄우고 호출하는 법은 «OpenAI 호환 서버로 서빙하기»에서 다뤄요.
  • 샘플링 옵션은 «생성 파라미터 다루기»를 확인하세요.