vLLM 온라인 서빙 — 배칭과 동시 요청 처리
vLLM 온라인 서빙 — 배칭과 동시 요청 처리
vLLM 의 온라인 서빙 문서는 OpenAI 호환 서버로 모델을 배포해 동시 요청을 batches로 처리하는 방법을 설명해요. vLLM은 내부적으로 연속 배칭(continuous batching) 을 적용해 요청이 오면 즉시 큐에 넣고 GPU 파이프라인을 끊김 없이 돌려요.
핵심 내용
vllm serve <model>로 OpenAI 호환/v1/chat/completions엔드포인트를 띄워요.- 동시 요청은 자동으로 배칭되어 높은 처리량을 내요.
- 스트리밍,
max_num_seqs배칭 크기, 동시 요청 수 제한 등을 서버 인자로 조절해요.
사용법
vllm serve meta-llama/Llama-3.1-8B-Instruct --max-num-seqs 32 --tensor-parallel-size 1
사용 팁
--max-num-seqs로 한 배치에 들어가는 최대 시퀀스 수를 조절해 처리량·지연을 트레이드오프해요.- 연속 배칭 덕에 많은 요청이 와도 GPU 유휴가 줄어요.