llm-d — vLLM 통합

llm-d — vLLM 통합

llm-d는 대규모 언어 모델을 대규모로 서빙하기 위한 Kubernetes 네이티브 분산 추론 프레임워크로, vLLM을 기본 추론 엔진으로 사용합니다. llm-d는 클러스터 전반의 vLLM 인스턴스 fleet을 조율해 실제 프로덕션 트래픽에서도 성능을 유지하며, 대부분의 하드웨어 가속기에서 주요 OSS 모델에 대해 가장 빠른 "SOTA 성능 도달 시간(time to state-of-the-art)"을 달성합니다.

Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA가 공동 창립한 CNCF 샌드박스 프로젝트입니다.

출처: 문서

본문

llm-d가 vLLM에 더해 주는 것 (What llm-d adds to vLLM)

단일 vLLM 서버는 빠르지만, 규모가 커지면 상황은 달라집니다. 많은 레플리카에서 라운드로빈 로드밸런싱에서는 캐시 지역성(locality)이 깨지고, 긴 프롬프트는 첫 토큰까지의 시간(TTFT)을 늘리며, 가속기는 충분히 활용되지 못합니다. llm-d는 vLLM이 스스로 제공하려 하지 않는 클러스터 수준의 계층을 더합니다:

이들은 조합 가능합니다. 대부분의 팀은 기존 vLLM 풀 위에 프리픽스 인지 라우팅부터 추가하고, 특정 병목이 나타나면 나머지를 단계적으로 쌓아 올립니다.

성능 (Performance)

가속기별 대표적인 벤치마크 결과입니다:

  • 프리픽스 인지 라우팅으로 라운드로빈 대비 출력 처리량 3배, TTFT 2배 단축 (Llama 3.1 70B, AMD MI300X)
  • prefill/decode 분리로 토큰/초 최대 70% 향상 (GPT-OSS, NVIDIA B200)
  • 계층형 KV 오프로딩으로 GPU 전용 대비 높은 동시성에서 처리량 13.9배 (NVIDIA H100)

전체 목록Prism의 재현 가능한 벤치마크를 참고하세요.

시작하기 (Get started)

  • Optimized BaselineQuickstart로 배포합니다. 테스트된 구성으로 Kubernetes 위 vLLM 풀 위에 지능형 라우터를 세웁니다.
  • well-lit path 가이드를 둘러보세요. 위 기능 각각에 대한 테스트된 레시피로, 워크로드에 맞는 최적화를 더할 수 있습니다.
  • IntroductionArchitecture overview를 읽어 이런 요소들이 vLLM 배포를 어떻게 감싸는지 확인하세요.

또한 KServe의 LLMInferenceService를 통해 llm-d와 함께 vLLM을 배포할 수도 있습니다.

질문과 기여는 GitHubSlack에서 받습니다.

더 알아보기 (Learn more)