KAITO — vLLM 통합
KAITO — vLLM 통합
KAITO는 vLLM으로 LLM을 배포·서빙하는 것을 지원하는 Kubernetes 운영자입니다. 내장된 OpenAI 호환 추론을 갖춘 컨테이너 이미지로 대형 모델을 관리하고, GPU 노드를 자동 프로비저닝하며, 큐레이션된 모델 프리셋을 제공합니다.
출처: 문서
본문
KAITO(Kubernetes AI Toolchain Operator)는 Kubernetes에서 머신러닝 모델을 자동화·간소화하는 것을 목표로 합니다. vLLM을 기본 서빙 엔진으로 사용해 OpenAI 호환 추론을 제공하며, GPU 노드의 자동 프로비저닝과 해제(autoprovision/deprovision)를 처리하므로 인프라를 수동으로 관리할 필요가 없습니다.
주요 특징:
- 대형 모델용 컨테이너 이미지 관리 — 모델을 컨테이너 이미지로 패키징해 버전 관리와 배포를 쉽게 합니다.
- 내장 OpenAI 호환 추론 — vLLM을 통해 OpenAI API와 호환되는 엔드포인트를 바로 제공합니다.
- 자동 GPU 노드 프로비저닝 — 워크로드에 맞춰 GPU 노드를 자동으로 만들고 정리합니다.
- 큐레이션된 모델 프리셋 — 검증된 모델 설정을 제공해 빠르게 시작할 수 있게 합니다.
어떻게 동작하나 (간단히)
KAITO 워커(operator)는 Workspace/Inference 리소스를 감시합니다. 모델 배포 요청이 들어오면:
- 필요한 GPU 노드가 없으면 GPU 노드를 자동 프로비저닝합니다 (auto-provision).
- 모델 컨테이너 이미지를 실행해 vLLM 추론 파드를 띄웁니다.
- 모델이 문제없이 로드되면
Ready상태가 되고 OpenAI 호환/v1엔드포인트로 추론을 제공합니다. - 워크로드가 끝나면 GPU 노드를 자동으로 정리(deprovision)해 비용을 절약합니다.
사용자는 모델 이름만 지정해도 미리 큐레이션된 프리셋 덕분에 이미지·리소스·추론 구성을 자동으로 맞출 수 있어, Kubernetes에서 vLLM을 빠르고 일관되게 배포하기 좋습니다.
자세한 내용은 퀵 스타트를 참고하세요.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- KAITO 문서 — 공식 문서
- KAITO 퀵 스타트 — 빠른 시작 가이드