SGLang 인퍼런스 엔진

SGLang 인퍼런스 엔진

SGLang은 대규모 언어 모델과 비전 언어 모델을 빠르게 서빙하기 위한 프레임워크예요. TGI나 vLLM과 아주 비슷한 자리에 있는 대안이며, 프로덕션에서 바로 쓸 수 있는 기능들을 기본으로 갖췄어요. 특히 RadixAttention이라는 프리픽스 캐싱 기법을 써서 반복되는 프롬프트가 많은 서비스에서 빛을 발해요.

핵심 기능

SGLang의 핵심 기능은 크게 두 갈래로 나눠 볼 수 있어요.

빠른 백엔드 런타임

  • RadixAttention 기반 프리픽스 캐싱으로 효율적인 서빙
  • 오버헤드가 없는(zero-overhead) CPU 스케줄러
  • 연속 배치, paged attention, 텐서 병렬·파이프라인 병렬 지원
  • expert parallelism, 구조화된 출력(structured outputs), chunked prefill 지원
  • 양자화(FP8/INT4/AWQ/GPTQ)와 multi-lora 배칭 지원

폭넓은 모델 지원

생성 모델(Llama, Gemma, Mistral, Qwen, DeepSeek, LLaVA 등)은 물론, 임베딩 모델(e5-mistral, gte, mcdse)과 보상 모델(Skywork)까지 폭넓게 지원해요. 새로운 모델을 통합하기도 쉽게 설계됐어요.

Docker 이미지와 배포

Inference Endpoints에서 SGLang 엔진을 선택하면, 허브에 있는 transformers 태그가 붙은 모델이라면 기본적으로 SGLang으로 배포할 수 있어요. 그 이유는 SGLang이 지원 목록에 없는 모델이라도 transformers 폴백을 구현해서 돌아가도록 해 두었기 때문이에요.

더 알아보기