KServe 소개 — 예측·생성형 AI를 함께 서빙하는 표준
KServe 소개
모델을 직접 배포해 보면 프레임워크마다 서빙 방식이 달라져서 고통스러울 때가 있어요. KServe는 쿠버네티스 위에서 예측(predictive) AI와 생성형(generative) AI를 함께 서빙하는 표준화된 오픈소스 플랫폼이에요. 2025년 11월 CNCF 인큐베이팅 프로젝트로 승인되었어요.
왜 KServe인가요
KServe는 쿠버네티스 **CustomResourceDefinition(CRD)**로 서빙 리소스를 표현해요. 자동 스케일링, 네트워킹, 헬스 체크, 서버 설정 같은 복잡한 부분을 캡슐화해서, ML 배포에 최신 서빙 기능을 제공해요.
- ML 프레임워크를 가로지르는 표준 K8s API
- 전/후처리와 설명 가능성(explainability)
- LLM을 위한 OpenAI 스펙 지원
- 카나리(canary) 롤아웃과 A/B 테스트
예시 — llama 모델 배포
apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
name: llm-service
spec:
predictor:
model:
modelFormat:
name: huggingface
resources:
limits:
cpu: "6"
memory: 24Gi
nvidia.com/gpu: "1"
storageUri: "hf://meta-llama/Llama-3.1-8B-Instruct"