Gateway API Inference Extension
Gateway API Inference Extension (Kubernetes Gateway API Inference Extension)
이 작업은 Kubernetes Gateway API의 Inference Extension을 사용하는 방법을 보여드려요. 이 확장을 사용하면 서비스에 대한 추론 워크로드의 오버/언더 프로비저닝을 자동으로 관리할 수 있어요.
출처: Istio 문서
본문
이 작업은 Kubernetes Gateway API Inference Extension을 사용하는 방법을 보여드려요. 인퍼런스 확장은 추론 서비스로 가는 트래픽을 모델 복제본의 실제 용량에 맞춰 지능적으로 라우팅해서 과부하를 방지하는 데 도움을 줘요.
시작하기 전에 (Before you begin)
- Gateway API CRD와 Inference Extension을 설치하세요.
- 테스트 추론 워크로드를 배포하세요.
Inference Extension 사용하기
InferenceExtension 리소스를 사용해서 추론 서비스의 데이터 모델과 오버/언더 프로비저닝 정책을 정의하면, 게이트웨이가 각 복제본의 부하를 고려해 트래픽을 분산해요. 상세 구성 YAML은 원문을 참고하세요.
더 알아보기 (Learn more)
- Kubernetes Gateway API와 Inference Extension에 대한 자세한 내용은 공식 문서를 참고하세요.