KubeAI — vLLM 통합
KubeAI — vLLM 통합
KubeAI는 Kubernetes에서 AI 모델을 배포·관리할 수 있게 해 주는 Kubernetes 오퍼레이터입니다. 프로덕션에서 vLLM을 간단하고 확장 가능한 방식으로 배포할 수 있게 하며, 제로 외부 의존성으로 scale-from-zero, 부하 기반 자동 확장, 모델 캐싱 등 기능을 기본 제공합니다.
출처: 문서
본문
설치 가이드는 환경별 지침을 제공합니다:
주요 기능:
- scale-from-zero — 요청이 들어올 때만 모델 레플리카를 켜고 유휴 시 정리합니다.
- 부하 기반 자동 확장 — 트래픽에 따라 레플리카 수를 조정합니다.
- 모델 캐싱 — 모델 가중치를 로컬에 캐시해 재사용합니다.
- 외부 의존성 없음 — 별도 컴포넌트 없이 동작합니다.
KubeAI를 설치한 뒤 텍스트 생성 모델 구성하기 문서를 따라 vLLM을 사용해 텍스트 생성 모델을 설정할 수 있습니다.
간단한 사용 예 (간단한 사용 예)
- KubeAI 오퍼레이터를 클러스터에 설치합니다 (환경별 지침: Any K8s/AKS/EKS/GKE).
Model리소스를 작성해 vLLM으로 서빙할 모델을 선언합니다. 모델 이미지·리소스·오토스케일링 옵션을 지정합니다.- 서빙이 준비되면 KubeAI가 노출하는 OpenAI 호환 엔드포인트로 요청을 보냅니다. 요청이 없으면 레플리카가 0으로 내려가고(scale-from-zero), 요청이 오면 자동으로 다시 뜹니다.
이런 구조 덕분에 상시 GPU를 띄워 두지 않고 요청 기반으로만 리소스를 사용할 수 있어 비용 효율적이며, 부하가 높은 구간은 자동 확장으로 처리량을 확보할 수 있습니다. 모델 가중치는 로컬 디스크에 캐싱되므로 콜드 스타트 시 재다운로드 부담도 줄어듭니다.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- KubeAI 문서 — 공식 문서
- KubeAI 레포지토리