TensorRT 개요 — 추론 가속이 왜 필요한가
TensorRT 개요 — 추론 가속이 왜 필요한가
훈련이 끝난 모델을 실제 서비스에서 쓰려면 속도가 중요해져요. 1만 분의 1 초가 아쉬운 순간, 모델을 그대로 두지 않고 NVIDIA GPU에 맞게 다시 컴파일하는 아이디어가 바로 TensorRT의 출발점이에요.
출처: https://docs.nvidia.com/deeplearning/tensorrt/latest/index.html
TensorRT는 PyTorch, TensorFlow, ONNX 같은 프레임워크에서 만든 모델을 받아서, GPU 배포용 엔진(engine) 으로 컴파일해요. 이 과정에서 레이어 퓨전, 커널 선택, 정밀도 선택 등이 자동으로 이뤄지죠. 특히 트랜스포머와 LLM을 위한 fused attention 같은 전용 최적화를 따로 제공해서 최신 모델에서 큰 효과를 봐요.
핵심 특징 몇 가지를 정리하면 이래요:
- 혼합 정밀도: FP32/FP16/BF16/FP8/INT8/FP4/INT4 를 지원해서 품질과 속도의 균형을 직접 고를 수 있어요.
- 동적 shape: 배치 크기나 해상도가 고정이 아니어도 실행 시점에 맞춰 조정해요.
- LLM 최적화: MoE(Mixture of Experts), 멀티 디바이스 추론, 레이지 배칭 같은 고급 기능이 있어요.
처음이라면 설치 → 검증(trtexec --help 또는 import tensorrt) → 첫 엔진 빌드 순서로 진행하면 돼요.
참고: pip 설치본은 바인딩과 라이브러리만 제공하고
trtexec는 포함하지 않아요. CLI 튜토리얼은 Debian/RPM, tar/zip, 컨테이너 설치에서 쓰는 걸 권장해요.