SGLang에 오신 것을 환영합니다

SGLang에 오신 것을 환영합니다 (Welcome to SGLang)

SGLang은 대규모 언어 모델과 멀티모달 모델을 위한 고성능 서빙 프레임워크예요. 전 세계 40만 개 이상의 GPU에서 매일 수조 개의 토큰을 생성하는 대규모 프로덕션 배포를 지원해요. 비영리 오픈소스 조직인 LMSYS가 호스팅하고 있어요.

출처: 문서

본문

SGLang은 프로덕션 수준 서빙을 위한 추론 프레임워크예요. 단일 GPU부터 대규모 분산 클러스터까지 다양한 설정에서 저지연·고처리량 추론을 제공하도록 설계됐어요.

주요 특징

  • Performance & Runtime: RadixAttention, 프리픽스 캐싱(prefix caching), 멀티 GPU 병렬 처리를 통한 저지연·고처리량 추론에 적합.
  • Models & Ecosystem: Llama, Qwen, DeepSeek 등을 광범위하게 지원하며 Hugging Face 및 OpenAI API와 호환.
  • Extensive Hardware Support: Hardware Platforms 전반에 걸친 네이티브 지원 — NVIDIA, AMD, Intel Xeon, Google TPU, Ascend NPU, Moore Threads MUSA 가속기 등.
  • Community & Training: 40만 개 이상의 GPU를 지원하고 주요 RL 프레임워크와 통합된 광범위한 채택을 지닌 오픈소스.

SGLang은 전 세계 40만 개 이상의 GPU에서 매일 수조 개의 토큰을 생성하는 대규모 프로덕션 배포를 지원해요. 비영리 오픈소스 조직인 LMSYS가 호스팅하고 있어요.


시작하기 (Get Started)

SGLang은 프로덕션 수준 서빙을 위한 추론 프레임워크예요. 단일 GPU부터 대규모 분산 클러스터까지 다양한 설정에서 저지연·고처리량 추론을 제공하도록 설계됐어요.

  • Install SGLang: 선호하는 하드웨어 플랫폼에 pip, 소스, 또는 Docker로 SGLang을 설치해요. → ./docs/get-started/install
  • Quickstart: 몇 분 안에 첫 모델 서버를 실행하고 OpenAI 호환 API로 요청을 보내요. → ./docs/get-started/quickstart

뉴스와 최신 블로그 (News and latest blogs)


더 알아보기 및 커뮤니티 참여 (Learn more and join the community)

더 알아보기