추론 성능 최적화
추론 성능 최적화
성능을 올리는 방법은 크게 세 갈래로 나뉘어요. 실행 공급자를 잘 고르기, 그래프 최적화 수준 조절하기, 그리고 모델을 양자화하기죠. 처음부터 다 적용할 필요는 없고, 병목을 먼저 찾는 게 좋아요.
벤치마크부터
ONNX Runtime은 자체 벤치마크 도구를 제공해서 실행 공급자별·설정별 지연을 비교할 수 있어요.
python -m onnxruntime.tools.benchmark -m model.onnx
조절 지점
- 실행 공급자: CUDA/TensorRT 등 하드웨어 가속기 선택
- 그래프 최적화: 그래프-수준 최적화 단계 조절
- 양자화: int8/half로 가중치 압축