대규모 언어 모델
대규모 언어 모델 (Large Language Models)
이 페이지는 SGLang이 지원하는 텍스트 생성 대규모 언어 모델(LLM)을 정리해요. 이 모델들은 텍스트 입력을 받아 텍스트 출력(예: 채팅 완성)을 생성하며, 주로 대규모 언어 모델이고 일부는 확장을 위해 mixture-of-experts(MoE) 아키텍처를 사용해요.
출처: 문서
본문
이 모델들은 텍스트 입력을 받아 텍스트 출력(예: 채팅 완성)을 생성해요. 주로 대규모 언어 모델(LLM)이며 일부는 확장을 위해 mixture-of-experts(MoE) 아키텍처를 사용해요.
예시 실행 명령 (Example launch Command)
python3 -m sglang.launch_server \
--model-path meta-llama/Llama-3.2-1B-Instruct \ # example HF/local path
--host 0.0.0.0 \
--port 30000 \
지원 모델 (Supported models)
지원 모델은 아래 표에 요약돼 있어요.
특정 아키텍처가 구현됐는지 확실하지 않으면 GitHub로 검색할 수 있어요. 예를 들어 Qwen3ForCausalLM을 검색하려면 GitHub 검색창에 다음 표현식을 사용해요:
repo:sgl-project/sglang path:/^python\/sglang\/srt\/models\// Qwen3ForCausalLM
| Model Family (Variants) | Example HuggingFace Identifier | Description |
|---|---|---|
| DeepSeek (v1, v2, v3/R1) | deepseek-ai/DeepSeek-R1 |
강화 학습으로 훈련된 고급 추론 최적화 모델 시리즈(671B MoE 포함); 복잡한 추론, 수학, 코드 작업에서 최고 성능. SGLang은 Deepseek v3/R1 모델별 최적화와 Reasoning Parser를 제공해요. |
| Kimi K2 (Thinking, Instruct) | moonshotai/Kimi-K2-Instruct |
Moonshot AI의 1조 파라미터 MoE 모델(32B 활성)로 128K |
| Kimi Linear (48B-A3B) | moonshotai/Kimi-Linear-48B-A3B-Instruct |
Moonshot AI의 하이브리드 선형 어텐션 모델(총 48B, 활성 3B)로 1M 토큰 컨텍스트. Kimi Delta Attention(KDA)으로 전체 어텐션 대비 최대 6배 빠른 디코딩과 75% KV 캐시 절감. |
| GPT-OSS | openai/gpt-oss-20b, openai/gpt-oss-120b |
복잡한 추론, 에이전트 작업, 다양한 개발자 사용 사례를 위한 OpenAI의 최신 GPT-OSS 시리즈. |
| Qwen (3.5, 3, 3MoE, 3Next, 2.5, 2 series) | Qwen/Qwen3.5-397B-A17B, Qwen/Qwen3-0.6B, Qwen/Qwen3-30B-A3B, Qwen/Qwen3-Next-80B-A3B-Instruct |
복잡한 추론, 언어 이해, 생성 작업을 위한 Alibaba의 최신 Qwen3 시리즈; MoE 변형과 이전 세대 2.5, 2 등을 지원. SGLang은 Qwen3 전용 reasoning parser를 제공해요. |
| Llama (2, 3.x, 4 series) | meta-llama/Llama-4-Scout-17B-16E-Instruct |
Meta의 오픈 LLM 시리즈, 7B에서 400B 파라미터(Llama 2, 3, 새 Llama 4)로 잘 알려진 성능. SGLang은 Llama-4 모델별 최적화 제공 |
| Mistral (Mixtral, NeMo, Small3) | mistralai/Mistral-7B-Instruct-v0.2 |
강력한 성능을 가진 Mistral AI의 오픈 7B LLM; 더 큰 규모를 위해 MoE("Mixtral")와 NeMo Megatron 변형으로 확장. |
| Gemma (v1, v2, v3) | google/gemma-3-1b-it |
Google의 효율적인 다국어 모델 패밀리(1B~27B); Gemma 3는 128K 컨텍스트 창을 제공하고 큰(4B+) 변형은 비전 입력 지원. |
| Phi (Phi-1.5, Phi-2, Phi-3, Phi-4, Phi-MoE series) | microsoft/Phi-4-multimodal-instruct, microsoft/Phi-3.5-MoE-instruct |
Microsoft의 소형 모델 Phi 패밀리(1.3B~5.6B); Phi-4-multimodal(5.6B)은 텍스트, 이미지, 음성을 처리하고 Phi-4-mini는 고정확도 텍스트 모델, Phi-3.5-MoE는 mixture-of-experts 모델. |
| MiniCPM (v3, 4B) | openbmb/MiniCPM3-4B |
엣지 기기를 위한 OpenBMB의 컴팩트 LLM 시리즈; MiniCPM 3(4B)는 텍스트 작업에서 GPT-3.5급 결과 달성. |
| OLMo (2, 3) | allenai/OLMo-3-1125-32B, allenai/OLMo-3-32B-Think, allenai/OLMo-2-1124-7B-Instruct |
언어 모델의 과학을 가능하게 하도록 설계된 Allen AI의 Open Language Model 시리즈. |
| OLMoE (Open MoE) | allenai/OLMoE-1B-7B-0924 |
Allen AI의 오픈 Mixture-of-Experts 모델(총 7B, 활성 1B 파라미터)로 희소 전문가 활성화로 최고 수준 결과. |
| MiniMax-M2 (M2, M2.1, M2.5) | MiniMaxAI/MiniMax-M2.5, MiniMaxAI/MiniMax-M2.1, MiniMaxAI/MiniMax-M2 |
코딩 및 에이전트 워크플로우를 위한 MiniMax의 SOTA LLM. |
| StableLM (3B, 7B) | stabilityai/stablelm-tuned-alpha-7b |
일반 텍스트 생성을 위한 StabilityAI의 초기 오픈소스 LLM(3B & 7B); 기본적인 지시 따르기 능력을 가진 데모 모델. |
| Command-(R,A) (Cohere) | CohereLabs/c4ai-command-r-v01, CohereLabs/c4ai-command-r7b-12-2024, CohereLabs/c4ai-command-a-03-2025 |
긴 컨텍스트, 검색 증강 생성, 도구 사용에 최적화된 Cohere의 오픈 대화 LLM(Command 시리즈). |
| DBRX (Databricks) | databricks/dbrx-instruct |
12T 토큰으로 훈련된 Databricks의 132B 파라미터 MoE 모델(36B 활성); 완전 오픈 파운데이션 모델로 GPT-3.5 품질과 경쟁. |
| Grok (xAI) | xai-org/grok-1 |
거대한 크기(314B 파라미터)와 고품질로 알려진 xAI의 grok-1 모델; 고성능 추론을 위해 SGLang에 통합. |
| ChatGLM (GLM-130B family) | THUDM/chatglm2-6b |
중국어-영어 대화에 뛰어난 Zhipu AI의 이중 언어 채팅 모델(6B); 대화 품질과 정렬을 위해 파인튜닝. |
| InternLM 2 (7B, 20B) | internlm/internlm2-7b |
SenseTime의 차세대 InternLM(7B와 20B), 강력한 추론과 초장기 컨텍스트 지원(최대 200K 토큰). |
| ExaONE 3 (한국어-영어) | LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct |
8T 토큰으로 훈련된 LG AI Research의 한국어-영어 모델(7.8B); 고품질 이중 언어 이해와 생성 제공. |
| Baichuan 2 (7B, 13B) | baichuan-inc/Baichuan2-13B-Chat |
개선된 성능과 오픈 상업 라이선스를 가진 BaichuanAI의 2세대 중국어-영어 LLM(7B/13B). |
| XVERSE (MoE) | xverse/XVERSE-MoE-A36B |
약 40개 언어를 지원하는 Yuanxiang의 오픈 MoE LLM(XVERSE-MoE-A36B: 총 255B, 활성 36B); 전문가 라우팅으로 100B+ 밀집 수준 성능 제공. |
| SmolLM (135M–1.7B) | HuggingFaceTB/SmolLM-1.7B |
놀랄 만큼 강력한 결과를 제공하는 Hugging Face의 초소형 LLM 시리즈(135M~1.7B 파라미터), 모바일/엣지 기기에서 고급 AI 가능하게 함. |
| GLM-4 (Multilingual 9B) | ZhipuAI/glm-4-9b-chat |
Zhipu의 GLM-4 시리즈(최대 9B 파라미터) — 1M 토큰 컨텍스트와 5.6B 멀티모달 변형(Phi-4V)을 지원하는 오픈 다국어 모델. |
| MiMo (7B series) | XiaomiMiMo/MiMo-7B-RL |
Xiaomi의 추론 최적화 모델 시리즈, Multiple-Token Prediction으로 더 빠른 추론 활용. |
| ERNIE-4.5 (4.5, 4.5MoE series) | baidu/ERNIE-4.5-21B-A3B-PT |
Baidu의 ERNIE-4.5 시리즈. 47B 및 3B 활성 파라미터의 MoE로 구성되며 가장 큰 모델은 총 424B, 그리고 0.3B 밀집 모델도 있음. |
| Arcee AFM-4.5B | arcee-ai/AFM-4.5B-Base |
실제 세계 신뢰성과 엣지 배포를 위한 Arcee의 파운데이션 모델 시리즈. |
| Persimmon (8B) | adept/persimmon-8b-chat |
16K 컨텍스트 창과 빠른 추론을 가진 Adept의 오픈 8B 모델; Apache 2.0 라이선스. |
| Solar (10.7B) | upstage/SOLAR-10.7B-Instruct-v1.0 |
지시 따르기 작업에 최적화된 Upstage의 10.7B 파라미터 모델. depth-up 스케일링 방법론을 통합해 성능 향상. |
| Tele FLM (52B-1T) | CofeAI/Tele-FLM |
520억 및 1조 파라미터 변형으로 제공되는 BAAI & TeleAI의 다국어 모델. ~2T 토큰으로 훈련된 디코더 전용 트랜스포머. |
| Ling (16.8B–290B) | inclusionAI/Ling-lite, inclusionAI/Ling-plus |
InclusionAI의 오픈 MoE 모델. Ling-Lite는 총 16.8B / 활성 2.75B, Ling-Plus는 총 290B / 활성 28.8B. NLP와 복잡한 추론 작업에서 고성능 설계. |
| Granite 3.0, 3.1 (IBM) | ibm-granite/granite-3.1-8b-instruct |
추론, 코드, 비즈니스 AI 사용 사례에 최적화된 IBM의 오픈 밀집 파운데이션 모델. Red Hat 및 watsonx 시스템과 통합. |
| Granite 3.0, 3.1 MoE (IBM) | ibm-granite/granite-3.0-3b-a800m-instruct, ibm-granite/granite-3.1-3b-a800m-instruct |
강한 성능과 비용 효율을 제공하는 IBM의 Mixture-of-Experts 모델. 엔터프라이즈 대규모 배포용으로 설계된 MoE 전문가 라우팅. 3.1은 공유 전문가 추가. |
| GPT-J (6B) | EleutherAI/gpt-j-6b |
Pile 데이터셋으로 훈련된 EleutherAI의 GPT-2 유사 인과 언어 모델(6B). |
| Orion (14B) | OrionStarAI/Orion-14B-Base |
중국어, 영어, 일본어, 한국어 등을 포함하는 2.5T 토큰 다국어 코퍼스로 사전 훈련된 OrionStarAI의 오픈소스 다국어 대규모 언어 모델 시리즈. |
| Llama Nemotron Super (v1, v1.5, NVIDIA) | nvidia/Llama-3\_3-Nemotron-Super-49B-v1, nvidia/Llama-3\_3-Nemotron-Super-49B-v1\_5 |
NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델. |
| Llama Nemotron Ultra (v1, NVIDIA) | nvidia/Llama-3_1-Nemotron-Ultra-253B-v1 |
NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델. |
| NVIDIA Nemotron Nano 2.0 | nvidia/NVIDIA-Nemotron-Nano-9B-v2 |
NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델. Nemotron-Nano-9B-v2는 추론 워크로드의 처리량을 높이면서 비슷한 크기 모델 대비 최고 수준 정확도를 달성하도록 설계된 하이브리드 Mamba-Transformer 언어 모델. |
| NVIDIA Nemotron 3 Super (NVIDIA) | nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 |
NVIDIA Nemotron 3 Super는 120B 파라미터 MoE 모델(12B 활성)로 엔터프라이즈 AI 에이전트를 위한 고품질 추론과 생성을 제공. |
| NVIDIA Nemotron 3 Nano (NVIDIA) | nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 |
NVIDIA Nemotron 3 Nano는 강력한 추론 능력을 가진 효율적인 엣지 및 엔터프라이즈 배포용 컴팩트 모델. |
| StarCoder2 (3B-15B) | bigcode/starcoder2-7b |
코드 생성과 이해에 특화된 오픈 대규모 언어 모델 패밀리. StarCoder의 후속으로 BigCode 프로젝트(Hugging Face, ServiceNow Research 등 협업)가 공동 개발. |
| Jet-Nemotron | jet-ai/Jet-Nemotron-2B |
최고 수준 오픈소스 전체 어텐션 언어 모델을 능가하면서 상당한 효율성 이득을 달성하는 하이브리드 아키텍처 언어 모델의 새 패밀리. |
| Trinity (Nano, Mini) | arcee-ai/Trinity-Mini |
Apache 2.0 아래 오픈 가중치인 Arcee의 파운데이션 MoE Trinity 패밀리. |
| LFM2 (230M, 350M, 1.2B) | LiquidAI/LFM2.5-1.2B-Instruct |
소수의 grouped query attention(GQA) 블록과 결합된 게이트 단기 합성곱(gated short convolutions)을 결합한 Liquid AI의 하이브리드 언어 모델. |
| LFM2-MoE (8B-A1B, 24B-A2B) | LiquidAI/LFM2-8B-A1B |
LFM2 하이브리드 백본의 Liquid AI 희소 Mixture-of-Experts 변형, SwiGLU 전문가, 정규화된 시그모이드 라우팅, top-k 전문가 선택 포함. |
| Falcon-H1 (0.5B–34B) | tiiuae/Falcon-H1-34B-Instruct |
효율적인 장기 컨텍스트 추론을 위해 어텐션과 상태 공간 모델을 결합한 TII의 하이브리드 Mamba-Transformer 아키텍처. |
| Mamba-Codestral (7B, Mamba2) | mistralai/Mamba-Codestral-7B-v0.1 |
코드 생성을 위한 Mistral AI의 순수 Mamba2 상태 공간 모델; 어텐션 대신 선택적 상태 공간을 사용하므로 KV 캐시를 보유하지 않음. |
| Hunyuan-Large (389B, MoE) | tencent/Tencent-Hunyuan-Large |
총 389B / 활성 52B 파라미터의 Tencent 오픈소스 MoE 모델, Cross-Layer Attention(CLA)으로 효율성 개선. |
| IBM Granite 4.0 (Hybrid, Dense) | ibm-granite/granite-4.0-h-micro, ibm-granite/granite-4.0-micro |
IBM Granite 4.0 micro 모델: 하이브리드 Mamba–MoE(h-micro)와 밀집(micro) 변형. 엔터프라이즈 중심 추론 모델. |
| Granite SWA (IBM) | ibm-granite/granite-swash-2b |
레이어별 슬라이딩 윈도우 어텐션과 학습 가능한 헤드별 어텐션 싱크를 가진 IBM Granite 밀집 모델. Granite 구현으로 서빙되며 transformers ≥ 5.15 필요. |
| Granite MoE SWA (IBM) | ibm-granite/granite-swash-3b-a600m |
레이어별 슬라이딩 윈도우 어텐션, 학습 가능한 어텐션 싱크, 선택적 공유 전문가를 가진 IBM Granite Mixture-of-Experts 모델. GraniteMoE 구현으로 서빙되며 transformers ≥ 5.15 필요. |
| Sarvam 2 (30B-A2B, 105B-A10B) | sarvamai/sarvam-2 |
Sarvam의 Mixture-of-Experts 모델. 105B 변형은 MLA(Multi-head Latent Attention), 30B 변형은 GQA를 사용하며 둘 다 128개의 라우팅 전문가를 가짐. |
| Laguna XS.2 (poolside) | poolside/Laguna-XS.2 |
Poolside의 하이브리드 슬라이딩-윈도우-어텐션 MoE 모델(라우팅 전문가 256개, 공유 전문가 1개, 시그모이드 라우터)로 레이어 유형별 RoPE(전체 어텐션 레이어에 YARN, 슬라이딩 어텐션 레이어에 기본값)와 softplus 헤드별 어텐션 게이트. |
| Mellum 2 (JetBrains) | JetBrains/Mellum2-12B-A2.5B-Base, JetBrains/Mellum2-12B-A2.5B-Thinking |
간헐적 슬라이딩-윈도우/전체 어텐션, 레이어 유형별 RoPE, 레이어별 밀집/희소 MLP 라우팅을 가진 JetBrains의 Qwen3-MoE 기반 코드 생성 모델. |
| GigaChat 3.5 | ai-sage/GigaChat3.5-432B-A28B |
GigaChat의 하이브리드 MoE 모델: 레이어별 DeepSeek 스타일 MLA 전체 어텐션과 Qwen3 Gated-Delta-Net(GDN) 선형 어텐션 혼합, DeepSeek 스타일 라우팅 + 공유 전문가, 스큘래티브 디코딩용 다중 multi-token-prediction(MTP) 헤드. GCML 형식으로 도구 호출 생성. |