TensorRT — NVIDIA GPU에서 추론을 가속하는 SDK
TensorRT
GPU에서 딥러닝 모델을 더 빠르게 돌리고 싶을 때 NVIDIA가 공식으로 제공하는 추론 최적화 SDK가 바로 TensorRT예요. 학습된 모델을 엔진(engine)으로 컴파일해서 FP32·FP16·BF16·FP8·INT8·FP4·INT4 같은 혼합 정밀도와 동적 shape, 트랜스포머·LLM 전용 최적화까지 지원해요. 아래 페이지에서 설치부터 첫 엔진 빌드, 성능 튜닝 흐름을 확인해 보세요.
출처: https://docs.nvidia.com/deeplearning/tensorrt/latest/index.html