SGLang에 오신 것을 환영합니다
SGLang에 오신 것을 환영합니다 (Welcome to SGLang)
SGLang은 대규모 언어 모델과 멀티모달 모델을 위한 고성능 서빙 프레임워크예요. 전 세계 40만 개 이상의 GPU에서 매일 수조 개의 토큰을 생성하는 대규모 프로덕션 배포를 지원해요. 비영리 오픈소스 조직인 LMSYS가 호스팅하고 있어요.
출처: 문서
본문
SGLang은 프로덕션 수준 서빙을 위한 추론 프레임워크예요. 단일 GPU부터 대규모 분산 클러스터까지 다양한 설정에서 저지연·고처리량 추론을 제공하도록 설계됐어요.
주요 특징
- Performance & Runtime: RadixAttention, 프리픽스 캐싱(prefix caching), 멀티 GPU 병렬 처리를 통한 저지연·고처리량 추론에 적합.
- Models & Ecosystem: Llama, Qwen, DeepSeek 등을 광범위하게 지원하며 Hugging Face 및 OpenAI API와 호환.
- Extensive Hardware Support: Hardware Platforms 전반에 걸친 네이티브 지원 — NVIDIA, AMD, Intel Xeon, Google TPU, Ascend NPU, Moore Threads MUSA 가속기 등.
- Community & Training: 40만 개 이상의 GPU를 지원하고 주요 RL 프레임워크와 통합된 광범위한 채택을 지닌 오픈소스.
SGLang은 전 세계 40만 개 이상의 GPU에서 매일 수조 개의 토큰을 생성하는 대규모 프로덕션 배포를 지원해요. 비영리 오픈소스 조직인 LMSYS가 호스팅하고 있어요.
시작하기 (Get Started)
SGLang은 프로덕션 수준 서빙을 위한 추론 프레임워크예요. 단일 GPU부터 대규모 분산 클러스터까지 다양한 설정에서 저지연·고처리량 추론을 제공하도록 설계됐어요.
- Install SGLang: 선호하는 하드웨어 플랫폼에 pip, 소스, 또는 Docker로 SGLang을 설치해요. → ./docs/get-started/install
- Quickstart: 몇 분 안에 첫 모델 서버를 실행하고 OpenAI 호환 API로 요청을 보내요. → ./docs/get-started/quickstart
뉴스와 최신 블로그 (News and latest blogs)
- Accelerating Long-Context and Agentic Inference with NVFP4 KV Cache — September 16, 2026
- SGLang and Miles Add Day-0 Support for DeepSeek-V4.1 — September 10, 2026
- Running DeepSeek-V4-Flash and Kimi-K3 on Consumer Hardware with SSD Expert Pack — August 29, 2026
- Infer-forge: Harness, Loop, and Graph Engineering Around SGLang — August 28, 2026
- MiniMax-H3 on 8×H200: 1.95× Lossless, Up to 6.24× at 0.76–0.91 SSIM — August 27, 2026
- Qwen3.8-Flash-Next: Day-0 Support in SGLang — August 26, 2026
더 알아보기 및 커뮤니티 참여 (Learn more and join the community)
- Development roadmap — 현재 우선순위와 예정 작업.
- Weekly public development meeting — 업데이트와 공개 토론 참여.
- Slack — 질문, 피드백, 커뮤니티 지원.
- X Twitter 및 LinkedIn — 프로젝트 업데이트.
- LMSYS blog — 릴리스 노트, 벤치마크, 기술 심층 분석.
- Learning materials — 블로그, 슬라이드, 비디오.