지원 모델 (Supported Models)
지원 모델 (Supported Models)
TensorRT-LLM으로 어떤 모델을 돌릴 수 있는지 궁금할 때 보는 페이지예요. PyTorch 백엔드 기준으로 모델 아키텍처별 기능 지원 여부를 정리해 두었어요. 아래 표는 핵심 모델에 대한 기능 매트릭스인데, 그 외 모델은 지원이 다를 수 있고 "N/A"로 표시된 기능은 해당 모델 아키텍처에 적용되지 않음을 뜻합니다.
모델·기능 지원 매트릭스 (핵심 모델)
다음은 PyTorch 백엔드의 지원 모델 표예요.
| Model Architecture/Feature | Overlap Scheduler | CUDA Graph | Attention Data Parallelism | Disaggregated Serving | Chunked Prefill | MTP | EAGLE-3 — Linear | EAGLE-3 — Dynamic | DFlash | Torch Sampler | TLLM C++ Sampler | KV Cache Reuse | Sliding Window Attention | Logits Post Processor | Guided Decoding |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
DeepseekV3ForCausalLM |
Yes | Yes | Yes | Yes | Yes [1] | Yes | No | No | No | Yes | Yes | Yes [2] | N/A | Yes | Yes |
DeepseekV32ForCausalLM |
Yes | Yes | Yes | Yes | Yes | Yes | No | No | No | Yes | Yes | Yes | N/A | Yes | Yes |
DeepseekV4ForCausalLM [11] |
Yes | Yes | Yes | Untested | Yes | Yes | No | No | No | Yes | Yes | Untested | Yes | Untested | Untested |
Glm4MoeForCausalLM |
Yes | Yes | Yes | Untested | Yes | Yes | No | No | No | Yes | Yes | Untested | N/A | Yes | Yes |
Qwen3MoeForCausalLM |
Yes | Yes | Yes | Yes | Yes | No | Yes | Yes | No | Yes | Yes | Yes | N/A | Yes | Yes |
Qwen3NextForCausalLM [3] |
Yes | Yes | Yes | Untested | Yes | No | No | No | No | Yes | Yes | No | No | Untested | Untested |
Qwen3_5MoeForCausalLM |
Yes | Yes | Yes | Yes | Yes | Yes | No | No | No | Yes | Untested | Yes | N/A | Untested | Untested |
Llama4ForConditionalGeneration |
Yes | Yes | Yes | Yes | Yes | No | Yes | Yes | No | Yes | Yes | Untested | N/A | Yes | Yes |
GptOssForCausalLM |
Yes | Yes | Yes | Yes | Yes | No | Yes | No | Yes | Yes | Yes | Yes | N/A | Yes | Yes |
Glm4MoeLiteForCausalLM [5] |
Yes | Yes | Untested | Untested | Yes | No | No | No | No | Yes | Untested | Untested | N/A | Untested | Untested |
NemotronHForCausalLM |
Yes | Yes | Yes | Yes | Yes | Yes | No | No | No | Yes | Yes | Yes | N/A | Untested | Untested |
Gemma4ForConditionalGeneration |
Untested | Yes | Untested | No | Yes | Yes | No | No | No | Yes | Untested | No | Yes | Untested | Untested |
Gemma4UnifiedForConditionalGeneration |
Untested | Untested | Untested | No | Yes | No | No | No | No | Yes | Untested | No | Yes | Untested | Untested |
Step3p7ForConditionalGeneration |
Yes | Yes | Yes | Untested | Untested | Yes | No | No | No | Yes | Untested | Untested | Yes | Untested | Untested |
MiniMaxM3SparseForConditionalGeneration [12] |
Yes | Yes | Yes | Untested | Untested | No | No | No | No | Yes | Untested | No | N/A | Untested | Untested |
인코더-디코더 기능 매트릭스 (PyTorch 백엔드)
다음 기능은 지원되는 인코더-디코더 아키텍처에 적용돼요. 구성 가이드와 제약은 PyTorch 백엔드에서 인코더-디코더 모델 사용 문서를 참고하세요.
디코더 CUDA 그래프는 KV 캐시 매니저 V1에서 greedy·빔 탐색 디코딩을, V2에서 단일 빔 디코딩을 지원해요. 인코더 CUDA 그래프는 토큰 입력의 BART, mBART, T5 계열을 지원하며, Whisper의 피처 주도 오디오 인코더는 eager하게 실행됩니다. 인코더-디코더 모델에는 TRTLLM 어텐션 백엔드를 사용해야 하고, 텐서 병렬화를 쓰려면 어텐션 헤드 수가 텐서 병렬 크기로 나누어 떨어져야 해요. 또한 인코더 단계는 청크 prefill이 지원되지 않으므로, 인코더 입력 전체가 iteration 토큰 예산 안에 들어가야 합니다.
시각 생성 모델 (Visual Generation Models)
TensorRT-LLM은 확산(diffusion) 기반 이미지·영상 생성에 베타 지원을 제공해요. 전체 문서는 Visual Generation 페이지를 참고하세요.
지원 모델
| HuggingFace Model ID | Tasks |
|---|---|
black-forest-labs/FLUX.1-dev |
Text-to-Image |
black-forest-labs/FLUX.2-dev |
Text-to-Image |
Wan-AI/Wan2.1-T2V-1.3B-Diffusers |
Text-to-Video |
Wan-AI/Wan2.1-T2V-14B-Diffusers |
Text-to-Video |
Wan-AI/Wan2.1-I2V-14B-480P-Diffusers |
Image-to-Video |
Wan-AI/Wan2.1-I2V-14B-720P-Diffusers |
Image-to-Video |
Wan-AI/Wan2.2-T2V-A14B-Diffusers |
Text-to-Video |
Wan-AI/Wan2.2-I2V-A14B-Diffusers |
Image-to-Video |
Wan-AI/Wan2.2-TI2V-5B-Diffusers |
Text-to-Video, Image-to-Video |
Lightricks/LTX-2 |
Text-to-Video (with Audio), Image-to-Video (with Audio) |
Qwen/Qwen-Image |
Text-to-Image |
Qwen/Qwen-Image-2512 |
Text-to-Image |
Qwen/Qwen-Image-Layered |
Image-to-Image |
Qwen/Qwen-Image-Edit-2511 |
Image Editing (text+images-to-image) |
nvidia/Cosmos3-Nano |
Text-to-Image, Text-to-Video, Image-to-Video |
nvidia/Cosmos3-Super |
Text-to-Image, Text-to-Video, Image-to-Video |
nvidia/Cosmos3-Super-Text2Image-4Step |
Text-to-Image (DMD2-distilled, fixed 4-step schedule) |
nvidia/Cosmos3-Super-Image2Video-4Step |
Image-to-Video (DMD2-distilled, fixed 4-step schedule) |
기능 매트릭스
| Model | FP8 blockwise | NVFP4 | TeaCache | CFG Parallelism | Ulysses Parallelism | Parallel VAE | CUDA Graph | torch.compile | trtllm-serve | Attention2D | Ring Attention | Tensor Parallelism |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| FLUX.1 | Yes | Yes | Yes | No [1] | Yes | No | Yes | Yes | Yes | Yes | Yes | Yes |
| FLUX.2 | Yes | Yes | Yes | No [1] | Yes | No | Yes | Yes | Yes | Yes | Yes | Yes |
| Wan 2.1 | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes |
| Wan 2.2 | Yes | Yes | No | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes | Yes |
| LTX-2 | Yes | Yes | No | Yes | Yes | No | No | Yes | Yes | Yes | Yes | No |
| Qwen-Image | Yes | Yes | Yes | Yes | Yes | No | Yes | Yes | Yes | Yes | Yes | No |
| Qwen-Image-Layered [3] | No | No | No | No | No | No | Yes | Yes | No | No | No | No |
| Qwen-Image-Edit-2511 | Yes | Yes | No | Yes | No | No | Yes | Yes | No | No | No | No |
| Cosmos3 | Yes | Yes | No | Yes | Yes | Yes | Yes | Yes | Yes | No | No | Yes |
더 알아보기 (Learn more)
- 인코더-디코더 모델 구성과 제약은 Use encoder-decoder models with the PyTorch backend를 참고해요.
- 시각 생성(베타) 전체 문서는 Visual Generation에서 다뤄요.
- 새 모델을 추가하는 절차는 Adding a New Model 문서를 확인해요.