KServe로 LLM 서빙하기 — Generative Inference(LLMISvc)
KServe로 LLM 서빙하기
KServe는 일반 예측 모델뿐 아니라 LLM 서빙을 위한 전용 컴포넌트(LLMISvc)를 제공해요. OpenAI 호환 스펙을 지원해서 기존 클라이언트를 그대로 쓸 수 있는 게 특징이에요.
출처: https://kserve.github.io/website/docs/model-serving/generative-inference/llmisvc/llmisvc-overview
LLM 서빙에서 다루는 것
- 카나리 롤아웃 — 새 모델 버전을 조금씩 트래픽에 올려 안정적으로 전환해요.
- LoRA 어댑터 — 같은 기본 모델 위에 여러 어댑터를 얹어 서빙해요.
- 자동 스케일링 & KV 캐시 오프로딩 — 생성형 추론 특유의 리소스 부담을 관리해요.
- Envoy AI 게이트웨이 통합으로 게이트웨이 계층과 연결할 수 있어요.
어떤 모델을 쓸 수 있나요
modelFormat: huggingface와 storageUri: hf://...을 이용하면 Hugging Face Hub의 모델을 직접 벤더 없이 서빙할 수 있어요. 생성형 모델 전용 배포 가이드(genai-first)도 제공돼요.