추론 성능 최적화

추론 성능 최적화

성능을 올리는 방법은 크게 세 갈래로 나뉘어요. 실행 공급자를 잘 고르기, 그래프 최적화 수준 조절하기, 그리고 모델을 양자화하기죠. 처음부터 다 적용할 필요는 없고, 병목을 먼저 찾는 게 좋아요.

벤치마크부터

ONNX Runtime은 자체 벤치마크 도구를 제공해서 실행 공급자별·설정별 지연을 비교할 수 있어요.

python -m onnxruntime.tools.benchmark -m model.onnx

조절 지점

  • 실행 공급자: CUDA/TensorRT 등 하드웨어 가속기 선택
  • 그래프 최적화: 그래프-수준 최적화 단계 조절
  • 양자화: int8/half로 가중치 압축

출처: https://onnxruntime.ai/docs/performance/

더 알아보기