지원 모델 (Supported Models)

지원 모델 (Supported Models)

TensorRT-LLM으로 어떤 모델을 돌릴 수 있는지 궁금할 때 보는 페이지예요. PyTorch 백엔드 기준으로 모델 아키텍처별 기능 지원 여부를 정리해 두었어요. 아래 표는 핵심 모델에 대한 기능 매트릭스인데, 그 외 모델은 지원이 다를 수 있고 "N/A"로 표시된 기능은 해당 모델 아키텍처에 적용되지 않음을 뜻합니다.

출처: 공식 문서 - Supported Models

모델·기능 지원 매트릭스 (핵심 모델)

다음은 PyTorch 백엔드의 지원 모델 표예요.

Model Architecture/Feature Overlap Scheduler CUDA Graph Attention Data Parallelism Disaggregated Serving Chunked Prefill MTP EAGLE-3 — Linear EAGLE-3 — Dynamic DFlash Torch Sampler TLLM C++ Sampler KV Cache Reuse Sliding Window Attention Logits Post Processor Guided Decoding
DeepseekV3ForCausalLM Yes Yes Yes Yes Yes [1] Yes No No No Yes Yes Yes [2] N/A Yes Yes
DeepseekV32ForCausalLM Yes Yes Yes Yes Yes Yes No No No Yes Yes Yes N/A Yes Yes
DeepseekV4ForCausalLM [11] Yes Yes Yes Untested Yes Yes No No No Yes Yes Untested Yes Untested Untested
Glm4MoeForCausalLM Yes Yes Yes Untested Yes Yes No No No Yes Yes Untested N/A Yes Yes
Qwen3MoeForCausalLM Yes Yes Yes Yes Yes No Yes Yes No Yes Yes Yes N/A Yes Yes
Qwen3NextForCausalLM [3] Yes Yes Yes Untested Yes No No No No Yes Yes No No Untested Untested
Qwen3_5MoeForCausalLM Yes Yes Yes Yes Yes Yes No No No Yes Untested Yes N/A Untested Untested
Llama4ForConditionalGeneration Yes Yes Yes Yes Yes No Yes Yes No Yes Yes Untested N/A Yes Yes
GptOssForCausalLM Yes Yes Yes Yes Yes No Yes No Yes Yes Yes Yes N/A Yes Yes
Glm4MoeLiteForCausalLM [5] Yes Yes Untested Untested Yes No No No No Yes Untested Untested N/A Untested Untested
NemotronHForCausalLM Yes Yes Yes Yes Yes Yes No No No Yes Yes Yes N/A Untested Untested
Gemma4ForConditionalGeneration Untested Yes Untested No Yes Yes No No No Yes Untested No Yes Untested Untested
Gemma4UnifiedForConditionalGeneration Untested Untested Untested No Yes No No No No Yes Untested No Yes Untested Untested
Step3p7ForConditionalGeneration Yes Yes Yes Untested Untested Yes No No No Yes Untested Untested Yes Untested Untested
MiniMaxM3SparseForConditionalGeneration [12] Yes Yes Yes Untested Untested No No No No Yes Untested No N/A Untested Untested

인코더-디코더 기능 매트릭스 (PyTorch 백엔드)

다음 기능은 지원되는 인코더-디코더 아키텍처에 적용돼요. 구성 가이드와 제약은 PyTorch 백엔드에서 인코더-디코더 모델 사용 문서를 참고하세요.

디코더 CUDA 그래프는 KV 캐시 매니저 V1에서 greedy·빔 탐색 디코딩을, V2에서 단일 빔 디코딩을 지원해요. 인코더 CUDA 그래프는 토큰 입력의 BART, mBART, T5 계열을 지원하며, Whisper의 피처 주도 오디오 인코더는 eager하게 실행됩니다. 인코더-디코더 모델에는 TRTLLM 어텐션 백엔드를 사용해야 하고, 텐서 병렬화를 쓰려면 어텐션 헤드 수가 텐서 병렬 크기로 나누어 떨어져야 해요. 또한 인코더 단계는 청크 prefill이 지원되지 않으므로, 인코더 입력 전체가 iteration 토큰 예산 안에 들어가야 합니다.

시각 생성 모델 (Visual Generation Models)

TensorRT-LLM은 확산(diffusion) 기반 이미지·영상 생성에 베타 지원을 제공해요. 전체 문서는 Visual Generation 페이지를 참고하세요.

지원 모델

HuggingFace Model ID Tasks
black-forest-labs/FLUX.1-dev Text-to-Image
black-forest-labs/FLUX.2-dev Text-to-Image
Wan-AI/Wan2.1-T2V-1.3B-Diffusers Text-to-Video
Wan-AI/Wan2.1-T2V-14B-Diffusers Text-to-Video
Wan-AI/Wan2.1-I2V-14B-480P-Diffusers Image-to-Video
Wan-AI/Wan2.1-I2V-14B-720P-Diffusers Image-to-Video
Wan-AI/Wan2.2-T2V-A14B-Diffusers Text-to-Video
Wan-AI/Wan2.2-I2V-A14B-Diffusers Image-to-Video
Wan-AI/Wan2.2-TI2V-5B-Diffusers Text-to-Video, Image-to-Video
Lightricks/LTX-2 Text-to-Video (with Audio), Image-to-Video (with Audio)
Qwen/Qwen-Image Text-to-Image
Qwen/Qwen-Image-2512 Text-to-Image
Qwen/Qwen-Image-Layered Image-to-Image
Qwen/Qwen-Image-Edit-2511 Image Editing (text+images-to-image)
nvidia/Cosmos3-Nano Text-to-Image, Text-to-Video, Image-to-Video
nvidia/Cosmos3-Super Text-to-Image, Text-to-Video, Image-to-Video
nvidia/Cosmos3-Super-Text2Image-4Step Text-to-Image (DMD2-distilled, fixed 4-step schedule)
nvidia/Cosmos3-Super-Image2Video-4Step Image-to-Video (DMD2-distilled, fixed 4-step schedule)

기능 매트릭스

Model FP8 blockwise NVFP4 TeaCache CFG Parallelism Ulysses Parallelism Parallel VAE CUDA Graph torch.compile trtllm-serve Attention2D Ring Attention Tensor Parallelism
FLUX.1 Yes Yes Yes No [1] Yes No Yes Yes Yes Yes Yes Yes
FLUX.2 Yes Yes Yes No [1] Yes No Yes Yes Yes Yes Yes Yes
Wan 2.1 Yes Yes Yes Yes Yes Yes Yes Yes Yes Yes Yes Yes
Wan 2.2 Yes Yes No Yes Yes Yes Yes Yes Yes Yes Yes Yes
LTX-2 Yes Yes No Yes Yes No No Yes Yes Yes Yes No
Qwen-Image Yes Yes Yes Yes Yes No Yes Yes Yes Yes Yes No
Qwen-Image-Layered [3] No No No No No No Yes Yes No No No No
Qwen-Image-Edit-2511 Yes Yes No Yes No No Yes Yes No No No No
Cosmos3 Yes Yes No Yes Yes Yes Yes Yes Yes No No Yes

더 알아보기 (Learn more)