Continuous Batching — 요청을 끊김 없이 GPU에 채우는 배칭

Continuous Batching (연속 배칭)

Continuous Batching(연속 배칭) 은 LLM 서빙에서 요청이 끝나는 대로 즉시 다른 요청의 토큰 생성을 시작해 GPU를 항상 바쁘게 유지하는 배칭 기법이에요. 정적 배칭(스태틱 배칭)이 느린 요청 때문에 전체를 막던 문제를 해결해 서빙 처리량을 크게 올려요. vLLM 같은 엔진의 핵심 기술이에요.

이 카테고리의 문서

  • 개요: vLLM 온라인 서빙 — 배칭·동시 요청 처리
  • 핵심 기능: Anyscale 블로그 — continuous batching으로 23배 처리량
  • 실전·API: Orca 논문 — 연속 배칭의 원형

출처: https://docs.vllm.ai/en/latest/serving/online_serving.html