NVIDIA Dynamo — vLLM 통합
NVIDIA Dynamo — vLLM 통합
NVIDIA Dynamo는 분산 LLM 추론을 위한 오픈소스 프레임워크로, 유연한 서빙 아키텍처(예: aggregated/disaggregated, 선택적 router/planner)로 vLLM을 Kubernetes에서 실행할 수 있게 합니다.
출처: 문서
본문
NVIDIA Dynamo는 대규모 LLM 서빙을 확장 가능한 다중 인스턴스(distributed) 방식으로 제공하는 런타임입니다. vLLM을 컴포넌트로 통합해 다음을 지원합니다:
- 비집중화/집중화 (disaggregated/aggregated) 서빙 — prefill과 decode를 분리하거나 함께 실행해 워크로드 특성에 맞춥니다.
- 선택적 라우터/플래너 — 추론 요청을 적절한 vLLM 인스턴스로 분배합니다.
- Kubernetes 배포 — 온프레미스·클라우드 클러스터에서 확장성 있게 운영합니다.
Kubernetes 배포 지침과 vLLM 포함 예제는 Kubernetes에 Dynamo 배포하기 가이드를 참고하세요.
배경 읽을거리: InfoQ 뉴스 — NVIDIA Dynamo simplifies Kubernetes deployment for LLM inference.
핵심 포인트
- Dynamo는 LLM 서빙을 "서빙 가능한 조립 식물(composable)"처럼 모델 파이프라인을 여러 컴포넌트(예: prefill, decode, 라우터)로 나눠 배치할 수 있게 합니다.
- vLLM은 Dynamo의 런타임에서 하나의 분산 실행 엔진으로 구동되며, 쿠버네티스 위에서 여러 vLLM 인스턴스를 유연하게 조정합니다.
- 라우터/플래너를 두어 요청을 적절한 인스턴스로 분배하면 다중 모델·다중 레플리카 서빙 시 부하를 고르게 분산할 수 있습니다.
Dynamo 기반 vLLM 배포를 시작하려면 Dynamo를 Kubernetes에 설치한 뒤(가이드 참고) vLLM 스택을 정의하고 헬름 차트나 매니페스트로 배포하면 됩니다. aggregated(단일 파이프라인) 방식과 disaggregated(prefill/decode 분리) 방식을 모두 지원하므로, TTFT가 중요한 서비스는 분리 구성을 선택하는 등 워크로드에 맞게 아키텍처를 조정할 수 있습니다.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- NVIDIA Dynamo — 오픈소스 레포지토리
- Kubernetes에 Dynamo 배포하기 — 공식 가이드