첫 엔진 빌드 — 10분 만에 돌려보는 전체 흐름

첫 엔진 빌드 — 10분 만에 돌려보는 전체 흐름

TensorRT가 내 환경에서 실제로 동작하는지 가장 빨리 확인하는 방법은, 작은 모델 하나를 골라 엔진으로 만들고 추론까지 돌려보는 거예요. 설치가 끝났다면 5개 명령으로 온전한 루프를 경험할 수 있어요.

출처: https://docs.nvidia.com/deeplearning/tensorrt/latest/getting-started/build-your-first-engine.html

1. 모델 준비 — ResNet-50 ONNX 모델을 내려받아요.

wget https://github.com/onnx/models/raw/main/validated/vision/classification/resnet/model/resnet50-v2-7.onnx \
    -O resnet50.onnx

2. 엔진 빌드trtexec 로 ONNX 파일을 엔진으로 컴파일해요. GPU에 따라 30~90초 정도 걸려요.

trtexec --onnx=resnet50.onnx --saveEngine=resnet50.engine

레이어 퓨전이나 커널 선택 로그가 보이고, 끝나면 엔진 크기와 빌드 시간이 출력돼요.

[I] [TRT] Some layers were fused during build.
[I] Engine built in 42.3 sec.
[I] Serialized engine size: 24 MiB

3. 추론 검증 — 임의 입력으로 엔진이 로드·실행되는지 확인해요.

trtexec --loadEngine=resnet50.engine --shapes=data:1x3x224x224

data 는 이 ONNX 모델의 입력 텐서 이름이고, 1x3x224x224 는 batch×channel×height×width 순서예요. 다른 모델을 쓰면 Netron 같은 도구로 입력 이름과 shape를 확인해서 바꿔 주세요. 결과 끝에 PASSED 가 보이면 성공이에요.

[I] Average on 10 runs - GPU latency: 1.2 ms (end to end)
[I] Throughput: 833.3 qps
[I] PASSED

숫자는 GPU·드라이버·CUDA 버전에 따라 달라져서 예시 수준으로만 보면 돼요. 성공 기준은 PASSED 가 나오는 거예요.

4. (선택) Python API — 파싱부터 엔진 빌드, 실제 이미지 입력, 추론까지 하나로 보고 싶다면 공식 onnx_resnet50.py 샘플을 참고하면 돼요.

더 알아보기