TensorRT-LLM (NVIDIA LLM 추론 엔진)

TensorRT-LLM

TensorRT-LLM은 NVIDIA가 만든 LLM 추론 최적화 라이브러리예요. PyTorch 기반의 모듈형 백엔드 위에서 CUDA와 TensorRT 기술을 활용해 GPU에서 대규모 언어 모델을 빠르고 효율적으로 서빙하도록 돕는 프레임워크죠.

핵심 특징

  • PyTorch 네이티브 고성능 추론: Python LLM API로 진입 장벽을 낮추고, 내부적으로 CUDA Graph·FlashAttention 같은 저수준 최적화를 적용해요.
  • 병렬화 전략 내장: 텐서·파이프라인·데이터 병렬화와 Disaggregated Serving을 지원해서 싱글 GPU부터 멀티 노드까지 확장돼요.
  • KV 캐시 고도화: 캐시 재사용(block reuse), 부분 재사용, CPU 오프로딩, 우선순위 기반 축출로 메모리와 재계산을 절약해요.
  • OpenAI 호환 서빙: trtllm-serve로 채팅·임베딩 등 OpenAI API 형태 엔드포인트를 제공해요.

이 카테고리의 문서

  • 시작: LLM API 소개와 빠른 시작, 지원 모델 목록
  • 추론 구조: 어텐션(MHA·MQA·GQA), KV 캐시 시스템
  • 서빙: Disaggregated Serving, 온라인 서빙, 임베딩(인코더 전용)
  • 고급: 양자화, 멀티모달, 시각 생성(베타)

출처: https://nvidia.github.io/TensorRT-LLM/