분산 추론·서빙 — TP와 PP 조합
분산 추론·서빙 — TP와 PP 조합
vLLM은 분산 텐서 병렬 추론·서빙을 지원해요. 파이프라인 병렬은 온라인 서빙에서 베타 기능으로 제공돼요. 런타임은 Ray 또는 파이썬 네이티브 멀티프로세싱으로 관리해요.
기본 규칙
- TP 크기 = 쓰고 싶은 GPU 수.
- 단일 노드면 멀티프로세싱, 다중 노드면 Ray 사용.
- 일반적으로 TP 크기는 노드 내 GPU 수, PP 크기는 노드 수로 정해요.
서버로 띄우기
vllm serve facebook/opt-13b --tensor-parallel-size 8 --pipeline-parallel-size 2
예: 2노드×8GPU라면 TP 8·PP 2로 설정해 16 GPU를 동원할 수 있어요. TP 없이 PP만 쓸 수도 있어요.
왜 TP인가
TP는 행렬 연산을 여러 GPU로 나눠 각 GPU의 메모리 부담을 줄여요. 70B처럼 큰 모델을 한 번에 적재하는 데 필수적이에요. 다만 GPU 간 통신(all-reduce)이 빈번하므로 고속 인터커넥트가 권장돼요.