vLLM 온라인 서빙 — 배칭과 동시 요청 처리

vLLM 온라인 서빙 — 배칭과 동시 요청 처리

vLLM 의 온라인 서빙 문서는 OpenAI 호환 서버로 모델을 배포해 동시 요청을 batches로 처리하는 방법을 설명해요. vLLM은 내부적으로 연속 배칭(continuous batching) 을 적용해 요청이 오면 즉시 큐에 넣고 GPU 파이프라인을 끊김 없이 돌려요.

핵심 내용

  • vllm serve <model> 로 OpenAI 호환 /v1/chat/completions 엔드포인트를 띄워요.
  • 동시 요청은 자동으로 배칭되어 높은 처리량을 내요.
  • 스트리밍, max_num_seqs 배칭 크기, 동시 요청 수 제한 등을 서버 인자로 조절해요.

사용법

vllm serve meta-llama/Llama-3.1-8B-Instruct     --max-num-seqs 32     --tensor-parallel-size 1

사용 팁

  • --max-num-seqs 로 한 배치에 들어가는 최대 시퀀스 수를 조절해 처리량·지연을 트레이드오프해요.
  • 연속 배칭 덕에 많은 요청이 와도 GPU 유휴가 줄어요.

더 알아보기