Tensor Parallel — 한 모델을 여러 GPU에 쪼개기

Tensor Parallel

모델 하나가 너무 커서 GPU 한 장에 안 들어갈 때, 레이어 단위가 아니라 텐서(가중치 행렬) 단위로 모델을 여러 GPU에 쪼개는 걸 텐서 병렬(Tensor Parallel, TP)이라고 해요. vLLM이 Megatron-LM 방식의 TP를 채택해 추론·서빙을 지원해요.

이 카테고리의 문서

  • 개요: 병렬화와 스케일링 — 텐서 병렬 선택 기준
  • 핵심 기능: 분산 추론·서빙 — TP와 PP 조합
  • 실전·API: 서빙에서의 TP·DP 구성 실전

출처: https://docs.vllm.ai/en/stable/serving/parallelism_scaling/