KServe 빠른 시작 — InferenceService 배포와 추론 요청

KServe 빠른 시작

KServe로 첫 모델을 띄우는 흐름은 '설치 → InferenceService 생성 → 추론 요청' 세 단계로 아주 단순해요. 몇 분 안에 배포를 경험해 볼 수 있어요.

출처: https://kserve.github.io/website/docs/getting-started/quickstart-guide

1. KServe 설치

버전 v0.11.0 기준, 클러스터에 매니페스트를 적용해 설치해요.

kubectl apply -f https://github.com/kserve/kserve/releases/download/v0.11.0/kserve.yaml

2. InferenceService 생성

사전 학습된 모델을 YAML 한 개로 배포해요.

apiVersion: serving.kserve.io/v1beta1
kind: InferenceService
metadata:
  name: qwen-llm
spec:
  predictor:
    model:
      modelFormat:
        name: huggingface
      storageUri: "hf://Qwen/Qwen2.5-0.5B-Instruct"
      resources:
        requests:
          cpu: "1"
          memory: 4Gi
          nvidia.com/gpu: "1"

3. 추론 요청

배포된 모델에 OpenAI 호환 엔드포인트로 요청을 보내요.

curl -v -H "Host: qwen-llm.default.example.com"    http://localhost:8080/openai/v1/chat/completions -d @./prompt.json

더 알아보기