KServe — vLLM 통합

KServe — vLLM 통합

vLLM은 Kubernetes에서 고도로 확장 가능한 분산 모델 서빙을 위해 KServe로 배포할 수 있습니다. KServe의 Hugging Face serving runtime 또는 llm-d를 사용하는 LLMInferenceService로 vLLM을 사용할 수 있습니다.

출처: 문서

본문

KServe는 Kubernetes에서 머신러닝 모델을 운영하기 위한 표준화된 서빙 플랫폼입니다. vLLM을 KServe와 함께 배포하면:

  • 표준화된 배포InferenceService 커스텀 리소스로 vLLM 모델을 선언적으로 배포합니다.
  • 자동 확장 (Serverless) — KServe의 Serverless 모드를 쓰면 요청량에 따라 vLLM 인스턴스가 자동으로 확장·축소됩니다.
  • 분산 추론 — 텐서 병렬 등 vLLM의 병렬 서빙을 활용해 큰 모델을 여러 GPU로 확장합니다.

vLLM을 KServe에서 쓰는 두 가지 방식:

  • Hugging Face serving runtime — KServe가 내장 지원하는 Hugging Face 계열 런타임으로 vLLM을 구동합니다.
  • LLMInferenceService (llm-d) — llm-d 기반의 LLMInferenceService로 vLLM을 분산 서빙합니다.

간단한 배포 흐름 (간단한 배포 흐름)

InferenceService YAML을 작성해 vLLM을 배포합니다. 서빙 런타임 이름과 모델(또는 이미지)을 지정하면 KServe가 파드·서비스·자동 확장을 관리합니다. GPU 가속을 위해 nvidia.com/gpu 리소스와 함께 배포할 수 있고, 모델이 크면 텐서 병렬 파라미터를 추가해 여러 GPU에 걸쳐 vLLM을 띄울 수 있습니다. 배포 후 KServe가 제공하는 https://<model>.<namespace>.example.com 형식의 추론 URL로 OpenAI 호환 요청을 보내면 됩니다.

KServe의 다양한 기능(서버리스 스케일투제로, 멀티레플리카, 카나리 롤아웃 등)은 vLLM의 배포와 함께 활용할 수 있어 프로덕션 LLM 서빙에 유용합니다.

더 알아보기 (Learn more)