분산 추론·서빙 — TP와 PP 조합

분산 추론·서빙 — TP와 PP 조합

vLLM은 분산 텐서 병렬 추론·서빙을 지원해요. 파이프라인 병렬은 온라인 서빙에서 베타 기능으로 제공돼요. 런타임은 Ray 또는 파이썬 네이티브 멀티프로세싱으로 관리해요.

기본 규칙

  • TP 크기 = 쓰고 싶은 GPU 수.
  • 단일 노드면 멀티프로세싱, 다중 노드면 Ray 사용.
  • 일반적으로 TP 크기는 노드 내 GPU 수, PP 크기는 노드 수로 정해요.

서버로 띄우기

vllm serve facebook/opt-13b   --tensor-parallel-size 8   --pipeline-parallel-size 2

예: 2노드×8GPU라면 TP 8·PP 2로 설정해 16 GPU를 동원할 수 있어요. TP 없이 PP만 쓸 수도 있어요.

왜 TP인가

TP는 행렬 연산을 여러 GPU로 나눠 각 GPU의 메모리 부담을 줄여요. 70B처럼 큰 모델을 한 번에 적재하는 데 필수적이에요. 다만 GPU 간 통신(all-reduce)이 빈번하므로 고속 인터커넥트가 권장돼요.

더 알아보기