TensorRT-LLM 성능 개요 — 모델별 처리량 레퍼런스

TensorRT-LLM 성능 개요

NVIDIA는 TensorRT-LLM으로 여러 GPU에서 주요 모델들의 성능을 측정해 레퍼런스 표로 공개해요. 이 수치는 '측정된 참고점'이지 최고 성능을 보장하는 게 아니에요. 배치·병렬화·설정을 튜닝하면 상황에 따라 더 좋아질 수 있어요.

측정 방식

  • 로컬 추론 클라이언트가 무한한 속도(요청 사이 지연 없음)로 요청을 보내는 최대 부하 처리량 시나리오.
  • 보고된 지표는 Total Output Throughput (tokens/sec).
  • 모델 가중치는 ModelOpt로 양자화해 사용.
  • 하드웨어: H100, H200, GH200, B200, GB200 등.

예시 — Llama 3.3 70B FP4

ISL(input)/OSL(output) 길이에 따라 처리량이 달라져요.

ISL, OSL B200 GB200
128, 128 10,613 11,100
128, 4096 6,276 7,351
1000, 1000 6,434 7,401

벤치마크 실행

PyTorch 백엔드로 엔진 빌드 없이 trtllm-bench로 바로 측정해요.

trtllm-bench --model $model_name throughput --dataset $dataset_file \
    --backend pytorch --extra_llm_api_options $llm_options

OOM이 나면 --kv_cache_free_gpu_mem_fraction으로 KV 캐시 비율을 낮춰보세요.

결론

실제 배치에서 성능을 검증하고, 논문·마케팅 수치에 휩쓸리지 않도록 자체 벤치를 돌리는 게 중요해요.

더 알아보기