SageMaker에서 Triton 사용하기
SageMaker에서 Triton 사용하기 (Use Triton on SageMaker)
AWS SageMaker에서 트리톤 인퍼런스 서버를 배포해 훈련된 모델을 프로덕션에서 서빙하려면, 아래 중요한 포인터들을 확인하세요.
트리톤이 SageMaker에서 어떻게 배포되는지에 대한 자세한 내용은 다음을 참고합니다.
- docker/sagemaker/serve — 트리톤 인퍼런스 서버가 SageMaker 환경에서 어떻게 배포되는지에 대한 상세 코드
- qa/L0_sakemaker/test.sh — 사용 예시와 테스트 방법
- AWS SageMaker 문서 — 플랫폼 자체에 대한 더 자세한 내용
AWS의 BasicServer와 달리, 트리톤이 SageMaker에서 실행되려면 모델 서버가 SageMaker의 추론 컨벤션에 맞게 동작해야 합니다. 위 docker/sagemaker/serve 코드가 바로 이 연동 — (1) SageMaker 엔드포인트가 요청을 받아들이고, (2) 트리톤이 그 요청을 처리하며, (3) SageMaker가 원하는 형식으로 응답을 돌려주는 흐름 — 을 담당합니다. 이 디렉토리 구조를 그대로 컨테이너 이미지로 빌드해 SageMaker 모델로 등록하면, 트리톤을 SageMaker 추론 엔드포인트에 통합할 수 있어요.
qa/L0_sakemaker/test.sh는 이 연동이 제대로 동작하는지 검증하는 테스트 스크립트로, 실제 SageMaker 배포 전에 로컬에서 흐름을 확인하는 용도로 유용합니다.
더 알아보기 (Learn more)
- Triton 사용자 가이드 — 모델 설정·배포 기초
- Amazon SageMaker 문서 — 엔드포인트·모델 등록
- Triton on Inferentia — AWS Inferentia 와 연동