Orca 논문 — 연속 배칭을 제안한 서빙 시스템

Orca 논문 — 연속 배칭을 제안한 서빙 시스템

Orca 논문은 트랜스포머 생성 모델을 위한 분산 서빙 시스템을 설계하며, 요청이 끝나는 즉시 새 요청을 스케줄 하는 연속 배칭(continuous iteration batching) 을 도입한 연구예요.

핵심 아이디어

  • 기존 시스템은 스태틱(static) 배칭으로 요청 묶음을 통째로 처리해 느린 요청이 전체를 막았어요.
  • Orca는 배치에 들어온 요청들을 iteration 단위로 보고, 각 요청이 끝나면 그 자리에 다른 요청을 바로 채워 넣어요.
  • 이 방식이 LLM 서빙 처리량을 크게 끌어올리는 토대가 됐어요.

결과

  • 연속 배칭으로 GPU 유휴를 줄여 서빙 처리량과 지연을 크게 개선했어요.
  • 이후 vLLM, Text Generation Inference 등 현대 LLM 서빙 엔진의 기본 원리가 됐어요.

더 알아보기