llmaz — vLLM 통합
llmaz — vLLM 통합
llmaz는 Kubernetes 상의 대규모 언어 모델을 위한 사용하기 쉽고 고급스러운 추론 플랫폼으로, 프로덕션 사용을 목표로 합니다. 기본 모델 서빙 백엔드로 vLLM을 사용합니다.
출처: 문서
본문
llmaz(InftyAI가 개발)는 Kubernetes 네이티브 방식으로 LLM 추론 서비스를 배포·관리하게 해 줍니다. vLLM을 기본 서빙 백엔드로 사용하므로 OpenAI 호환 추론 엔드포인트를 얻을 수 있고, 멀티모델 관리, 자동 확장, 롤링 업데이트 등 Kubernetes의 이점을 그대로 살릴 수 있습니다.
주요 특징:
- Kubernetes 네이티브 — 커스텀 리소스(CRD)를 통해 모델 서빙을 선언적으로 관리합니다.
- 기본 vLLM 백엔드 — vLLM을 모델 서빙 엔진으로 사용합니다.
- 프로덕션 지향 — 실제 운영 환경에서 대규모 LLM 서빙을 위해 설계됐습니다.
핵심 포인트:
- llmaz는 CRD 기반으로 모델 서빙을 선언하므로, 재배포 없이 모델·리소스 구성을 갱신할 수 있습니다.
- KEDA 기반의 자동 확장을 지원해 트래픽(또는 사용자 정의 지표)에 따라 vLLM 워커 수를 조정합니다.
- 다중 모델을 한 클러스터에서 관리하고, 롤링 업데이트·GPUSharing 같은 Kubernetes 네이티브 기능을 활용할 수 있어 프로덕션 운영에 적합합니다.
일반적인 사용은 OpenModel CR을 작성해 모델 아키텍처·추론 엔진(vLLM)·리소스를 선언하면, llmaz 컨트롤러가 해당 설정으로 vLLM 서빙 파드를 만들고 프런트엔드(런타임) 서비스로 추론 엔드포인트를 노출합니다. 워크로드가 끝나거나 사용하지 않으면 리소스를 정리해 GPU 비용을 아낄 수 있으며, 모델이 인기도에 따라 자동으로 스케일 인/아웃되는 형태로 운영됩니다.
자세한 내용은 Quick Start를 참고하세요.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- llmaz 레포지토리
- llmaz 퀵 스타트