ONNX Runtime — 크로스 플랫폼 모델 추론 엔진
ONNX Runtime — 크로스 플랫폼 모델 추론 엔진
ONNX Runtime(ORT)은 Python·C/C++·C#·Java·node.js 등 다양한 언어와 CPU·GPU·엣지 디바이스에서 ONNX 모델을 효율적으로 실행하는 크로스 플랫폼 추론 엔진이에요. 파이토치·텐서플로 등 어떤 프레임워크에서 학습했든 ONNX 포맷으로만 바꾸면 같은 코드로 어디서든 돌릴 수 있습니다.
ONNX Runtime의 핵심은 Execution Provider(EP) 프레임워크예요. 하드웨어 가속 라이브러리를 플러그인처럼 붙여서 CUDA GPU, TensorRT, OpenVINO, CoreML 등에 맞춰 모델 실행을 최적화합니다. 그래서 "어느 하드웨어에서든 같은 ONNX 모델을 가장 빠르게" 실행하는 게 목표예요.