llm-d — vLLM 통합
llm-d — vLLM 통합
llm-d는 대규모 언어 모델을 대규모로 서빙하기 위한 Kubernetes 네이티브 분산 추론 프레임워크로, vLLM을 기본 추론 엔진으로 사용합니다. llm-d는 클러스터 전반의 vLLM 인스턴스 fleet을 조율해 실제 프로덕션 트래픽에서도 성능을 유지하며, 대부분의 하드웨어 가속기에서 주요 OSS 모델에 대해 가장 빠른 "SOTA 성능 도달 시간(time to state-of-the-art)"을 달성합니다.
Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA가 공동 창립한 CNCF 샌드박스 프로젝트입니다.
출처: 문서
본문
llm-d가 vLLM에 더해 주는 것 (What llm-d adds to vLLM)
단일 vLLM 서버는 빠르지만, 규모가 커지면 상황은 달라집니다. 많은 레플리카에서 라운드로빈 로드밸런싱에서는 캐시 지역성(locality)이 깨지고, 긴 프롬프트는 첫 토큰까지의 시간(TTFT)을 늘리며, 가속기는 충분히 활용되지 못합니다. llm-d는 vLLM이 스스로 제공하려 하지 않는 클러스터 수준의 계층을 더합니다:
- 프리픽스 인지 라우팅 (Prefix-aware routing) — 라운드로빈 대신 llm-d는 vLLM의 KV-cache 이벤트를 읽고 각 요청을 이미 해당 프리픽스를 보유한 레플리카로 라우팅해, 캐시를 재계산하지 않고 재사용합니다.
- 분산 KV-cache 관리 (Distributed KV-cache management) — 전역 인덱스가 각 토큰 블록이 어느 레플리카에 있는지 추적하고, 티어형 오프로딩(tiered offloading)으로 캐시를 CPU 메모리나 로컬 SSD로 넘겨 가속기 HBM 너머로 워킹 셋을 확장합니다.
- Prefill/Decode 분리 (Prefill/decode disaggregation) — 프롬프트 처리와 토큰 생성이 별도 vLLM 워커에서 실행되고, KV-cache는 vLLM NIXL 커넥터를 통해 이동합니다. 긴 프롬프트에서 TTFT를 낮추고 토큰당 지연시간을 안정화합니다.
- 광범위 전문가 병렬 (Wide expert-parallelism) — DeepSeek-R1이나 GPT-OSS 같은 대형 Mixture-of-Experts 모델을 데이터·전문가 병렬을 결합해 노드 전반에서 서빙해, 더 많은 KV-cache 용량과 처리량을 얻습니다.
- SLO 인지 오토스케일링과 흐름 제어 (flow control) — 원시 GPU 활용률이 아니라 실제 추론 신호(큐 깊이, 실제 수요)에 기반해 vLLM 풀을 확장하며, 멀티테넌트 공정성과 우선순위 디스패치를 제공합니다.
이들은 조합 가능합니다. 대부분의 팀은 기존 vLLM 풀 위에 프리픽스 인지 라우팅부터 추가하고, 특정 병목이 나타나면 나머지를 단계적으로 쌓아 올립니다.
성능 (Performance)
가속기별 대표적인 벤치마크 결과입니다:
- 프리픽스 인지 라우팅으로 라운드로빈 대비 출력 처리량 3배, TTFT 2배 단축 (Llama 3.1 70B, AMD MI300X)
- prefill/decode 분리로 토큰/초 최대 70% 향상 (GPT-OSS, NVIDIA B200)
- 계층형 KV 오프로딩으로 GPU 전용 대비 높은 동시성에서 처리량 13.9배 (NVIDIA H100)
전체 목록과 Prism의 재현 가능한 벤치마크를 참고하세요.
시작하기 (Get started)
- Optimized Baseline을 Quickstart로 배포합니다. 테스트된 구성으로 Kubernetes 위 vLLM 풀 위에 지능형 라우터를 세웁니다.
- well-lit path 가이드를 둘러보세요. 위 기능 각각에 대한 테스트된 레시피로, 워크로드에 맞는 최적화를 더할 수 있습니다.
- Introduction과 Architecture overview를 읽어 이런 요소들이 vLLM 배포를 어떻게 감싸는지 확인하세요.
또한 KServe의 LLMInferenceService를 통해 llm-d와 함께 vLLM을 배포할 수도 있습니다.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- llm-d 문서 — 공식 문서와 가이드
- llm-d GitHub — 레포지토리와 성능 하이라이트
- KServe LLMInferenceService — KServe로 llm-d 배포