SGLang 인퍼런스 엔진
SGLang 인퍼런스 엔진
SGLang은 대규모 언어 모델과 비전 언어 모델을 빠르게 서빙하기 위한 프레임워크예요. TGI나 vLLM과 아주 비슷한 자리에 있는 대안이며, 프로덕션에서 바로 쓸 수 있는 기능들을 기본으로 갖췄어요. 특히 RadixAttention이라는 프리픽스 캐싱 기법을 써서 반복되는 프롬프트가 많은 서비스에서 빛을 발해요.
핵심 기능
SGLang의 핵심 기능은 크게 두 갈래로 나눠 볼 수 있어요.
빠른 백엔드 런타임
- RadixAttention 기반 프리픽스 캐싱으로 효율적인 서빙
- 오버헤드가 없는(zero-overhead) CPU 스케줄러
- 연속 배치, paged attention, 텐서 병렬·파이프라인 병렬 지원
- expert parallelism, 구조화된 출력(structured outputs), chunked prefill 지원
- 양자화(FP8/INT4/AWQ/GPTQ)와 multi-lora 배칭 지원
폭넓은 모델 지원
생성 모델(Llama, Gemma, Mistral, Qwen, DeepSeek, LLaVA 등)은 물론, 임베딩 모델(e5-mistral, gte, mcdse)과 보상 모델(Skywork)까지 폭넓게 지원해요. 새로운 모델을 통합하기도 쉽게 설계됐어요.
Docker 이미지와 배포
Inference Endpoints에서 SGLang 엔진을 선택하면, 허브에 있는 transformers 태그가 붙은 모델이라면 기본적으로 SGLang으로 배포할 수 있어요. 그 이유는 SGLang이 지원 목록에 없는 모델이라도 transformers 폴백을 구현해서 돌아가도록 해 두었기 때문이에요.
더 알아보기
- SGLang 공식 문서에서 백엔드와 모델 통합을 더 자세히 볼 수 있어요
- transformers 폴백 문서로 지원 폭을 확인해 보세요