TensorRT 퀵 스타트 가이드
TensorRT 퀵 스타트 가이드
TensorRT SDK를 처음 시작하는 분을 위한 가이드예요. TensorRT 엔진에서 추론을 실행하는 애플리케이션을 어떻게 구성하는지 보여줘요. 컨테이너, Debian 파일, 독립 pip wheel 등 다양한 설치 방법과, 모델을 변환·배포하는 여러 워크플로우를 살펴볼 수 있어요.
이 가이드에서 만들 것
가이드가 끝나면 다음 세 가지를 갖게 돼요.
trtexec명령줄 도구로 엔진을 빌드·벤치마킹할 수 있는 TensorRT 설치- ONNX에서 TensorRT 엔진으로 변환해 엔드투엔드로 배포한 ResNet-50 이미지 분류기
- C++·Python TensorRT 런타임 API를 통해 실행되는 시맨틱 세그멘테이션 모델
설치 방법 고르기
설치 방법은 크게 네 가지로 나뉘어요. 용도에 따라 고르면 돼요.
- pip (Python): 파이썬 개발용. 루트 권한 불필요,
trtexec없음, 가장 빠름(~2분). - Debian/RPM: 시스템 전체 설치용. 루트 권한 필요,
trtexec포함. - Tar/Zip: 여러 버전을 함께 쓸 때. 루트 권한 불필요,
trtexec포함. - Container (NGC): 격리된 환경용. Docker 사용,
trtexec포함.
pip로 설치하면 TensorRT 라이브러리와 Python 바인딩을 함께 얻을 수 있어요. Python에서 C++을 작성하지 않고도 엔진을 빌드·저장·실행할 수 있죠.
설치 확인하기
설치 방법에 따라 확인 방법이 달라요. Debian/RPM/tar/zip/컨테이너는 trtexec를 포함하므로 이렇게 확인해요.
trtexec --help
Python에서 버전도 확인할 수 있어요.
import tensorrt as trt
print(trt.__version__)
pip 전용 설치라면 trtexec --help가 동작하지 않을 테니, 이렇게 확인해요.
import tensorrt as trt
print(trt.__version__)
assert trt.Builder(trt.Logger())
두 검사가 모두 성공하면 Build Your First Engine으로 진행해서 약 10분 만에 테스트 엔진을 빌드·실행해 볼 수 있어요.
TensorRT 배포 옵션
모델을 배포하는 방법은 세 가지가 있어요. 배포 옵션에 따라 우선 가정이 달라져요.
- PyTorch 내 배포 (Torch-TensorRT): TensorRT 연산이 삽입된 PyTorch 그래프로 변환돼요. 다른 PyTorch 모델처럼 Python에서 실행할 수 있어요.
- 독립 실행 TensorRT 런타임 API: 가장 낮은 오버헤드와 세밀한 제어를 제공해요. 하지만 TensorRT가 기본 지원하지 않는 연산은 플러그인으로 구현해야 해요. 가장 흔한 경로는 프레임워크에서 ONNX로 내보내는 거예요.
- NVIDIA Triton Inference Server: HTTP로 모델을 서빙하거나 다중 모델·다중 프레임워크를 관리해야 할 때 좋아요.
워크플로우 선택하기
변환·배포 방법을 고를 때 가장 중요한 두 가지는 프레임워크 선택과 타깃 런타임 선택이에요. 권장하는 빌드-런 경로는 Example Deployment Using ONNX와 Using the TensorRT Runtime API예요.