KubeAI — vLLM 통합

KubeAI — vLLM 통합

KubeAI는 Kubernetes에서 AI 모델을 배포·관리할 수 있게 해 주는 Kubernetes 오퍼레이터입니다. 프로덕션에서 vLLM을 간단하고 확장 가능한 방식으로 배포할 수 있게 하며, 제로 외부 의존성으로 scale-from-zero, 부하 기반 자동 확장, 모델 캐싱 등 기능을 기본 제공합니다.

출처: 문서

본문

설치 가이드는 환경별 지침을 제공합니다:

주요 기능:

  • scale-from-zero — 요청이 들어올 때만 모델 레플리카를 켜고 유휴 시 정리합니다.
  • 부하 기반 자동 확장 — 트래픽에 따라 레플리카 수를 조정합니다.
  • 모델 캐싱 — 모델 가중치를 로컬에 캐시해 재사용합니다.
  • 외부 의존성 없음 — 별도 컴포넌트 없이 동작합니다.

KubeAI를 설치한 뒤 텍스트 생성 모델 구성하기 문서를 따라 vLLM을 사용해 텍스트 생성 모델을 설정할 수 있습니다.

간단한 사용 예 (간단한 사용 예)

  1. KubeAI 오퍼레이터를 클러스터에 설치합니다 (환경별 지침: Any K8s/AKS/EKS/GKE).
  2. Model 리소스를 작성해 vLLM으로 서빙할 모델을 선언합니다. 모델 이미지·리소스·오토스케일링 옵션을 지정합니다.
  3. 서빙이 준비되면 KubeAI가 노출하는 OpenAI 호환 엔드포인트로 요청을 보냅니다. 요청이 없으면 레플리카가 0으로 내려가고(scale-from-zero), 요청이 오면 자동으로 다시 뜹니다.

이런 구조 덕분에 상시 GPU를 띄워 두지 않고 요청 기반으로만 리소스를 사용할 수 있어 비용 효율적이며, 부하가 높은 구간은 자동 확장으로 처리량을 확보할 수 있습니다. 모델 가중치는 로컬 디스크에 캐싱되므로 콜드 스타트 시 재다운로드 부담도 줄어듭니다.

더 알아보기 (Learn more)