Triton Inference Server — NVIDIA 멀티프레임워크 추론 서빙

Triton Inference Server — NVIDIA 멀티프레임워크 추론 서빙

NVIDIA Triton Inference Server 는 AI 추론을 간소화하는 오픈소스 추론 서빙 소프트웨어예요. TensorRT, PyTorch, ONNX, OpenVINO, Python, RAPIDS FIL 등 다양한 딥러닝·머신러닝 프레임워크의 AI 모델을 한 곳에서 배포할 수 있게 해줍니다.

출처: https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/index.html

Triton은 NVIDIA GPU, x86·ARM CPU, AWS Inferentia 위에서 클라우드·데이터센터·엣지·임베디드 전반에 걸쳐 추론을 지원하고, 실시간·배치·앙상블·오디오/비디오 스트리밍 등 다양한 질의 타입에 최적화된 성능을 제공해요. 아래 페이지에서 아키텍처, 빠른 시작, 모델 저장소·설정을 살펴볼게요.