KServe 빠른 시작 — InferenceService 배포와 추론 요청
KServe 빠른 시작
KServe로 첫 모델을 띄우는 흐름은 '설치 → InferenceService 생성 → 추론 요청' 세 단계로 아주 단순해요. 몇 분 안에 배포를 경험해 볼 수 있어요.
출처: https://kserve.github.io/website/docs/getting-started/quickstart-guide
1. KServe 설치
버전 v0.11.0 기준, 클러스터에 매니페스트를 적용해 설치해요.
kubectl apply -f https://github.com/kserve/kserve/releases/download/v0.11.0/kserve.yaml
2. InferenceService 생성
사전 학습된 모델을 YAML 한 개로 배포해요.
apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
name: qwen-llm
spec:
predictor:
model:
modelFormat:
name: huggingface
storageUri: "hf://Qwen/Qwen2.5-0.5B-Instruct"
resources:
requests:
cpu: "1"
memory: 4Gi
nvidia.com/gpu: "1"
3. 추론 요청
배포된 모델에 OpenAI 호환 엔드포인트로 요청을 보내요.
curl -v -H "Host: qwen-llm.default.example.com" http://localhost:8080/openai/v1/chat/completions -d @./prompt.json