SGLang Diffusion

SGLang Diffusion

SGLang Diffusion은 이미지와 비디오 생성을 위한 고성능 추론 프레임워크예요. 네이티브 SGLang 파이프라인, diffusers 백엔드 지원, OpenAI 호환 서버, 그리고 사전 컴파일된 sgl-kernel 연산자와 주요 추론 경로의 JIT 커널로 구성된 최적화된 커널 스택을 제공해요. Wan, Hunyuan, Qwen-Image, FLUX 등 다양한 모델을 빠르게 실행하고 싶을 때 시작하기 좋은 문서예요.

출처: 문서

본문

SGLang Diffusion은 이미지 및 비디오 생성을 위한 고성능 추론 프레임워크예요. 네이티브 SGLang 파이프라인, diffusers 백엔드 지원, OpenAI 호환 서버, 그리고 사전 컴파일된 sgl-kernel 연산자와 주요 추론 경로의 JIT 커널을 기반으로 한 최적화된 커널 스택을 제공해요.

핵심 기능 (Key Features)

  • Wan, Hunyuan, Qwen-Image, FLUX, Z-Image, GLM-Image 등 광범위한 모델 지원
  • sgl-kernel, JIT 커널, 스케줄러 개선, 캐싱 가속화를 통한 빠른 추론
  • sglang generate, sglang serve, 그리고 OpenAI 호환 API 등 여러 인터페이스 제공
  • NVIDIA, AMD, Intel XPU, Ascend, Apple Silicon, Moore Threads 등 멀티 플랫폼 지원

빠른 시작 (Quick Start)

uv pip install "sglang[diffusion]" --prerelease=allow
sglang generate --model-path Qwen/Qwen-Image \
  --prompt "A beautiful sunset over the mountains" \
  --save-output
sglang serve --model-path Qwen/Qwen-Image --port 30010

여기서 시작하기 (Start Here)

  • Installation: SGLang Diffusion 및 플랫폼 의존성 설치
  • Supported Models: 지원되는 모델 패밀리, 작업, 공개 체크포인트 둘러보기
  • CLI: 일회성 생성 작업 실행 또는 영구 서버 시작
  • OpenAI-Compatible API: HTTP 서버에 이미지/비디오 요청 보내기
  • Performance Overview: 속도, 메모리, 병렬화, 캐싱, 품질 트레이드오프 조절 장치 선택
  • Caching Acceleration: Cache-DiT, TeaCache, Spectrum으로 디노이징 비용 절감
  • Quantization: 컴포넌트 체크포인트 및 인과적 KV-cache 양자화 구성
  • Realtime and Causal Video Models: 세션 상태, 인과적 캐시, 실시간 전용 컨트롤 이해하기
  • Contributing: 기여 워크플로우, 새 모델 추가, CI 성능 기준선

추가 문서 (Additional Documentation)

개발자 문서 (Developer Documentation)

참고 자료 (References)

더 알아보기