TensorRT-LLM 성능 개요 — 모델별 처리량 레퍼런스
TensorRT-LLM 성능 개요
NVIDIA는 TensorRT-LLM으로 여러 GPU에서 주요 모델들의 성능을 측정해 레퍼런스 표로 공개해요. 이 수치는 '측정된 참고점'이지 최고 성능을 보장하는 게 아니에요. 배치·병렬화·설정을 튜닝하면 상황에 따라 더 좋아질 수 있어요.
측정 방식
- 로컬 추론 클라이언트가 무한한 속도(요청 사이 지연 없음)로 요청을 보내는 최대 부하 처리량 시나리오.
- 보고된 지표는
Total Output Throughput (tokens/sec). - 모델 가중치는 ModelOpt로 양자화해 사용.
- 하드웨어: H100, H200, GH200, B200, GB200 등.
예시 — Llama 3.3 70B FP4
ISL(input)/OSL(output) 길이에 따라 처리량이 달라져요.
| ISL, OSL | B200 | GB200 |
|---|---|---|
| 128, 128 | 10,613 | 11,100 |
| 128, 4096 | 6,276 | 7,351 |
| 1000, 1000 | 6,434 | 7,401 |
벤치마크 실행
PyTorch 백엔드로 엔진 빌드 없이 trtllm-bench로 바로 측정해요.
trtllm-bench --model $model_name throughput --dataset $dataset_file \
--backend pytorch --extra_llm_api_options $llm_options
OOM이 나면 --kv_cache_free_gpu_mem_fraction으로 KV 캐시 비율을 낮춰보세요.
결론
실제 배치에서 성능을 검증하고, 논문·마케팅 수치에 휩쓸리지 않도록 자체 벤치를 돌리는 게 중요해요.