지원 모델

지원 모델 (Supported Models)

이 페이지는 SGLang Diffusion이 지원하는 모델 패밀리와 공개 체크포인트를 안내해요. 이미지/3D, 비디오/오디오, 월드/액션 카테고리별로 정리되어 있고, 각 모델의 쿡북(cookbook) 링크와 모델별 검증 상태가 포함돼 있어요.

출처: 문서

본문

Qwen-Image 2.1 통합 상태 (Qwen-Image 2.1 integration status)

Qwen-Image 2.1은 text-to-image와 선택적 reference-image conditioning을 위한 별도의 네이티브 파이프라인을 가져요. H200의 전체 체크포인트 검증은 1024×1024, 40스텝 생성과 편집을 포함해요. 참조 비교는 Transformers 4.57.3, BF16, cuDNN SDPA가 비활성화된 일치하는 Torch SDPA 설정을 사용해요. 네이티브 인코더는 그 버전의 pre-final-norm hidden state와 비전 위치 보간 의미를 명시적으로 보존해요.

최대 두 H200 GPU의 전체 체크포인트 기능 검사는 DiT TP, Ulysses, Ring + FA, CFG parallel, DiT 레이어 단위 offload, FA/Sage, 병렬 tiled VAE 디코드, Cache-DiT, breakable CUDA graphs, 여러 reference 이미지와 출력을 다뤄요. 상주 가중치가 있는 한 H200도 HTTP 생성 및 편집(다중 출력과 reference 이미지 포함)을 통과했어요. 이들은 손실 최적화의 광범위한 품질 평가가 아닌 기능 검사예요.

B200의 추가 전체 체크포인트 검사는 네이티브 인코더 TP, 4 GPU에서 결합된 TP2 × Ulysses2와 TP2 × Ring2 + FA, --layerwise-offload-components all을 다뤄요. 2 GPU VAE spatial_shard 디코드는 TP2, CFG 병렬 처리, 전 컴포넌트 offload로 통과했어요. 이들은 512px/4스텝 편집과 공간/전체 VAE 디코드의 1024px/4스텝 비교를 사용해요. 단일 GPU 1024px/40스텝 생성, 편집, 투명 PNG 출력은 소스 리비전 d629d234f1에서도 통과했어요.

Two-B200 컴포넌트 회귀는 실제 인코더 가중치 샤딩을 검증하고 단일 랭크 참조로 텍스트/이미지 조건을 비교해요. VAE 회귀는 두 디코더 구조와 FP32/FP64의 짝/홀 잠재 높이를 다뤄요. FP64 공간 디코드는 전체 디코더와 일치하고, BF16 전체 체크포인트 출력은 비트 정확하지 않아요. 테스트된 이미지에서 공간 대비 전체 디코드는 RGBA PSNR 60.69dB를 줬어요. 이는 하나의 샘플이며 일반적인 품질 보장이 아니에요.

Request-local prefix KV 재사용과 new-request graph replay는 배칭된 대상과 독립적인 가변 길이 프리픽스를 포함한 CUDA 회귀 테스트를 가져요. 호환되는 text-to-image 요청은 옵트인 동적 배칭을 지원하고, image-edit 요청은 분리되어 유지되며 한 요청 내 다중 출력은 지원돼요. 배포 설정과 부동소수점 재현성 한계는 쿡북의 batching guidance를 참고해요. 배포 선택기는 정확히 테스트된 HTTP 조합(H200, B200, RTX PRO 6000 96GB, RTX 5090, RTX 4090 포함)만 검증된 것으로 표시해요. CLI 전용 조합은 선택기에서 미검증으로 남아요.

1eab5de5990에서 한 RTX PRO 6000 Blackwell Server Edition이 상주 가중치 또는 DiT 레이어 단위 offload와 Torch SDPA로 1024px/40스텝 HTTP 생성, 편집, 투명 생성, 투명 입력 편집을 반복 통과했어요. 배치에 걸친 반복 요청과 대응 출력은 RGBA 픽셀이 일치했고, 투명 출력은 0에서 255의 알파를 유지했어요. 그 SM120 RoPE, 정규화, fusion-gate, 모델 회귀도 통과했어요. 이 검사는 해당 플랫폼에서 다중 GPU 또는 양자화 체크포인트 커버리지를 수립하지 않아요.

분리 encoder, denoiser, decoder 역할은 Mooncake의 동일 호스트 TCP 전송을 사용해 세 B200 GPU에서 전체 체크포인트 HTTP 생성, 가변 길이 프롬프트, 이미지 편집, CFG를 통과했어요. 512px/4스텝에서 RGBA 픽셀이 단일(monolithic) 서버와 정확히 일치했어요. 다중 호스트 RDMA와 다중 랭크 역할은 그 검사로 다뤄지지 않아요.

DiT, 인코더, 둘 다에 대한 온라인 FP8이 한 B200에서 1024px/40스텝 HTTP 생성과 편집을 통과했고, 둘 다 함께 투명 PNG 생성도 통과했어요. 직렬화된 E4M3FN FP8 컴포넌트 폴더(스칼라 가중치 스케일, 동적 활성화)는 각 컴포넌트와 둘 모두에서 생성, 편집, 투명 출력을 통과했어요. 결합된 내보내기는 TP2 + 인코더 폴딩과 단일 GPU 전 컴포넌트 레이어 단위 offload의 별도 검사도 통과했어요. 로드된 476개의 양자화 행렬과 스케일이 체크포인트 값과 일치했어요. 양자화와 TP는 수치 결과를 바꿔요. 리비전 f1f3366c7c는 CPU/GPU 전송 중 비전 로터리 초기화 반올림을 수정해요. 1024px/40스텝 B200 검사에서 전 컴포넌트 레이어 단위 offload가 네이티브 정밀도와 결합 직렬화 내보내기 모두에서 상주 생성, 편집, 투명 RGBA 픽셀과 정확히 일치했어요. 리비전 81c8c550fa는 추가로 인코더 전체 CPU offload 중 FP8 가중치와 FP32 버퍼를 보존하며, 그 모드의 별도 검사도 상주 픽셀과 일치했어요. 상주 출력은 이 수정으로 변하지 않았어요. 샘플 품질 메트릭은 쿡북을 참고해요.

네이티브 이름 Q4_0 GGUF 파일은 DiT 전용, 인코더 전용, 둘 모두에 대해 1024px/40스텝 B200 HTTP 생성, 편집, 투명 출력을 통과했어요. 476개의 패킹된 행렬이 내보낸 바이트와 일치했어요. 결합 내보내기는 인코더 폴딩이 있는 TP2도 통과했고, 별도 전 컴포넌트 레이어 단위 및 인코더 전체 CPU offload 검사는 상주 RGBA 픽셀과 정확히 일치했어요. 양자화와 TP는 알파를 포함해 출력 픽셀을 바꿔요. 이 검사들은 문서화된 비공개 내보내기를 다루며 임의 커뮤니티 체크포인트가 아니에요. 이 모델의 다른 GGUF 유형과 하드웨어는 미검증이에요.

보정된 ModelOpt 형식 NVFP4 컴포넌트 디렉터리도 동일한 여섯 구성 B200 HTTP 매트릭스(각 컴포넌트, 둘 함께, 두 offload 모드, 인코더 폴딩이 있는 TP2)를 통과했어요. 모든 476 패킹된 행렬과 그 스케일이 런타임 레이아웃 변환 후 내보내기와 일치했어요. 두 offload 모드는 상주 RGBA 픽셀과 정확히 일치했어요. NVFP4와 TP2는 이미지와 알파 값을 바꿔요. 이 비공개 내보내기는 SVDQuant나 AWQ 없이 6개 요청에만 최대 보정을 사용해요. 측정된 오류는 쿡북을 참고해요. 네이티브 FP4는 Blackwell이 필요하며, 이 모델의 NVFP4 내보내기는 RTX PRO 6000과 RTX 5090에서 미검증이에요.

합성 Diffusers 형식 LoRA는 한 B200과 인코더 폴딩이 있는 TP2에서 동적 로딩, 병합, 제거를 통과했고, 두 제거 경로 모두 기본 이미지를 정확히 복원했어요. 훈련된 어댑터 품질은 미검증이에요. 플랫폼 지연 시간 측정과 그 정확한 워크로드는 쿡북에 있어요. Breakable graphs는 condition-prefix 길이를 포함한 일치하는 워밍업 시그니처만 재생하며, 다른 형태는 eager로 실행돼요. VAE 타일링은 옵트인이며 수치 결과를 바꿀 수 있어요. 더 오래된 Qwen-Image 행에서 호환성을 추론하지 마세요.

공개 Qwen/Qwen-Image-2.1 체크포인트를 사용해요. Hugging Face 토큰이 필요 없어요. 체크포인트 레이아웃과 사용법은 Qwen-Image 2.1 cookbook을 참고해요. 표준 2-GPU E2E 스위트는 TP2, 1024px/40스텝 생성, 두 요청, 이미지 일관성 검사를 가진 qwen_image21_t2i_tp2를 포함해요.

추가 옵트인 HTTP 사례는 로컬 체크포인트에서 반복 생성, 편집, 실제 RGBA 알파 출력을 검사해요:

export SGLANG_QWEN_IMAGE21_TEST_MODEL=/models/Qwen-Image-2.1
export SGLANG_QWEN_IMAGE21_TEST_IMAGE=/path/to/reference.png
python -m pytest -q python/sglang/multimodal_gen/test/server/test_server_qwen_image21.py

모듈은 모델 변수 없이 건너뛰고, 이미지 변수가 없으면 편집만 건너뛰어요. 자격 증명은 러너 환경에 유지돼요.

지원 모델 인벤토리 (Supported model inventory)

나열된 체크포인트를 sglang generate 또는 sglang serve--model-path로 사용해요. 이 레지스트리 기반 목록은 알려진 공개 진입점을 포함하며, 패밀리 감지가 호환되는 로컬 디렉터리를 지원할 수도 있어요. 실행 명령, 최적화, 어댑터, 모델별 참고 사항은 링크된 Cookbook 레시피를 열어 확인해요.

이미지 및 3D (Image and 3D)

모델 패밀리 체크포인트 ID 쿡북
FLUX black-forest-labs/FLUX.1-dev, black-forest-labs/FLUX.2-dev, black-forest-labs/FLUX.2-dev-NVFP4, black-forest-labs/FLUX.2-klein-4B, black-forest-labs/FLUX.2-klein-9B, black-forest-labs/FLUX.2-klein-base-4B, black-forest-labs/FLUX.2-klein-base-9B FLUX
Qwen-Image Qwen/Qwen-Image, nvidia/Qwen-Image-NVFP4, Qwen/Qwen-Image-2512 Qwen-Image
Qwen-Image 2.1 Qwen/Qwen-Image-2.1 Qwen-Image-2.1
Qwen-Image Edit / Layered Qwen/Qwen-Image-Edit, Qwen/Qwen-Image-Edit-2509, Qwen/Qwen-Image-Edit-2511, Qwen/Qwen-Image-Layered Qwen-Image-Edit
Z-Image Tongyi-MAI/Z-Image, Tongyi-MAI/Z-Image-Turbo Z-Image-Turbo
Krea-2 krea/Krea-2 Krea-2
LongCat-Image meituan-longcat/LongCat-Image, meituan-longcat/LongCat-Image-Edit, meituan-longcat/LongCat-Image-Edit-Turbo LongCat-Image
Stable Diffusion 3 / 3.5 stabilityai/stable-diffusion-3-medium, stabilityai/stable-diffusion-3-medium-diffusers, stabilityai/stable-diffusion-3.5-medium, stabilityai/stable-diffusion-3.5-medium-diffusers, stabilityai/stable-diffusion-3.5-large, stabilityai/stable-diffusion-3.5-large-diffusers
SANA Efficient-Large-Model/SANA1.5_1.6B_1024px_diffusers, Efficient-Large-Model/SANA1.5_4.8B_1024px_diffusers, Efficient-Large-Model/Sana_1600M_1024px_diffusers, Efficient-Large-Model/Sana_600M_1024px_diffusers, Efficient-Large-Model/Sana_1600M_512px_diffusers, Efficient-Large-Model/Sana_600M_512px_diffusers
Ideogram 4 ideogram-ai/ideogram-4-fp8, ideogram-ai/ideogram-4-nf4, Comfy-Org/Ideogram-4, fal/ideogram-v4-fast, fal/ideogram-v4-instant Ideogram4
ERNIE-Image baidu/ERNIE-Image, baidu/ERNIE-Image-Turbo Ernie-Image
FireRed-Image FireRedTeam/FireRed-Image-Edit-1.0, FireRedTeam/FireRed-Image-Edit-1.1
JoyAI-Image jdopensource/JoyAI-Image-Edit-Diffusers
SenseNova-U1.5 sensenova/SenseNova-U1.5-8B-MoT SenseNova-U1.5-8B-MoT
GLM-Image zai-org/GLM-Image — (GLM-Image 패밀리 감지기로 해석)
Hunyuan3D 2 tencent/Hunyuan3D-2

비디오 및 오디오 (Video and audio)

모델 패밀리 체크포인트 ID 쿡북
Wan 2.1 Wan-AI/Wan2.1-T2V-1.3B-Diffusers, Wan-AI/Wan2.1-T2V-14B-Diffusers, Wan-AI/Wan2.1-I2V-14B-480P-Diffusers, Wan-AI/Wan2.1-I2V-14B-720P-Diffusers, weizhou03/Wan2.1-Fun-1.3B-InP-Diffusers Wan2.1
Wan 2.2 Wan-AI/Wan2.2-TI2V-5B-Diffusers, Wan-AI/Wan2.2-T2V-A14B-Diffusers, nvidia/Wan2.2-T2V-A14B-Diffusers-NVFP4, Wan-AI/Wan2.2-I2V-A14B-Diffusers Wan2.2
FastWan / TurboWan FastVideo/FastWan2.1-T2V-1.3B-Diffusers, FastVideo/FastWan2.2-TI2V-5B-FullAttn-Diffusers, FastVideo/FastWan2.2-TI2V-5B-Diffusers, IPostYellow/TurboWan2.1-T2V-1.3B-Diffusers, IPostYellow/TurboWan2.1-T2V-14B-Diffusers, IPostYellow/TurboWan2.1-T2V-14B-720P-Diffusers, IPostYellow/TurboWan2.2-I2V-A14B-Diffusers Wan2.2
LTX 2 / 2.3 Lightricks/LTX-2, Lightricks/LTX-2.3 LTX2 & LTX2.3
LTX 2.5 Lightricks/LTX-2.5-Diffusers LTX2.5
HunyuanVideo hunyuanvideo-community/HunyuanVideo, FastVideo/FastHunyuan-diffusers
LongLive 2.0 Rabinovich/LongLive-2.0-5B-Diffusers, Efficient-Large-Model/LongLive-2.0-5B LongLive-2.0
MiniMax-H3 MiniMaxAI/MiniMax-H3, MiniMax/MiniMax-H3 MiniMax-H3
FastH3 FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree FastH3
VDN-H3 OpenVDN/vdn-minimax-h3 VDN-H3
MOVA OpenMOSS-Team/MOVA-360p, OpenMOSS-Team/MOVA-720p MOVA — (MOVA 해상도 감지기로 해석)
JoyAI-Echo jdopensource/JoyAI-Echo JoyEcho
SANA-Video Efficient-Large-Model/SANA-Video_2B_480p_diffusers SANA-Video
LingBot Video MoE robbyant/lingbot-video-moe-30b-a3b LingBot-Video-MoE — (LingBot Video MoE 패밀리 감지기로 해석)
Helios BestWishYsh/Helios-Base, BestWishYsh/Helios-Mid, BestWishYsh/Helios-Distilled

월드 및 액션 (World and action)

모델 패밀리 체크포인트 ID 쿡북
Cosmos 3 nvidia/Cosmos3-Nano, nvidia/Cosmos3-Nano-Policy-DROID, nvidia/Cosmos3-Super, nvidia/Cosmos3-Super-Text2Image, nvidia/Cosmos3-Super-Image2Video, nvidia/Cosmos3-Edge Cosmos3
LingBotWorld IPostYellow/lingbot-world-fast-diffusers, robbyant/lingbot-world-fast-diffusers LingBot-World
LingBotWorld 2.0 robbyant/lingbot-world-v2-14b-causal-fast-diffusers LingBot-World-2.0
SANA-WM Efficient-Large-Model/SANA-WM_bidirectional, Efficient-Large-Model/SANA-WM_streaming SANA-WM
Pi0.5 lerobot/pi05_base, lerobot/pi05_libero_base Pi0.5

더 알아보기