대규모 언어 모델

대규모 언어 모델 (Large Language Models)

이 페이지는 SGLang이 지원하는 텍스트 생성 대규모 언어 모델(LLM)을 정리해요. 이 모델들은 텍스트 입력을 받아 텍스트 출력(예: 채팅 완성)을 생성하며, 주로 대규모 언어 모델이고 일부는 확장을 위해 mixture-of-experts(MoE) 아키텍처를 사용해요.

출처: 문서

본문

이 모델들은 텍스트 입력을 받아 텍스트 출력(예: 채팅 완성)을 생성해요. 주로 대규모 언어 모델(LLM)이며 일부는 확장을 위해 mixture-of-experts(MoE) 아키텍처를 사용해요.

예시 실행 명령 (Example launch Command)

python3 -m sglang.launch_server \
  --model-path meta-llama/Llama-3.2-1B-Instruct \  # example HF/local path
  --host 0.0.0.0 \
  --port 30000 \

지원 모델 (Supported models)

지원 모델은 아래 표에 요약돼 있어요.

특정 아키텍처가 구현됐는지 확실하지 않으면 GitHub로 검색할 수 있어요. 예를 들어 Qwen3ForCausalLM을 검색하려면 GitHub 검색창에 다음 표현식을 사용해요:

repo:sgl-project/sglang path:/^python\/sglang\/srt\/models\// Qwen3ForCausalLM
Model Family (Variants) Example HuggingFace Identifier Description
DeepSeek (v1, v2, v3/R1) deepseek-ai/DeepSeek-R1 강화 학습으로 훈련된 고급 추론 최적화 모델 시리즈(671B MoE 포함); 복잡한 추론, 수학, 코드 작업에서 최고 성능. SGLang은 Deepseek v3/R1 모델별 최적화Reasoning Parser를 제공해요.
Kimi K2 (Thinking, Instruct) moonshotai/Kimi-K2-Instruct Moonshot AI의 1조 파라미터 MoE 모델(32B 활성)로 128K256K 컨텍스트를 가지며, 200300번의 순차 도구 호출에 걸친 안정적인 장기 에이전트 수행으로 최고 수준의 에이전트 지능. MLA 어텐션과 네이티브 INT4 양자화 특징. Reasoning Parser 문서 참고.
Kimi Linear (48B-A3B) moonshotai/Kimi-Linear-48B-A3B-Instruct Moonshot AI의 하이브리드 선형 어텐션 모델(총 48B, 활성 3B)로 1M 토큰 컨텍스트. Kimi Delta Attention(KDA)으로 전체 어텐션 대비 최대 6배 빠른 디코딩과 75% KV 캐시 절감.
GPT-OSS openai/gpt-oss-20b, openai/gpt-oss-120b 복잡한 추론, 에이전트 작업, 다양한 개발자 사용 사례를 위한 OpenAI의 최신 GPT-OSS 시리즈.
Qwen (3.5, 3, 3MoE, 3Next, 2.5, 2 series) Qwen/Qwen3.5-397B-A17B, Qwen/Qwen3-0.6B, Qwen/Qwen3-30B-A3B, Qwen/Qwen3-Next-80B-A3B-Instruct 복잡한 추론, 언어 이해, 생성 작업을 위한 Alibaba의 최신 Qwen3 시리즈; MoE 변형과 이전 세대 2.5, 2 등을 지원. SGLang은 Qwen3 전용 reasoning parser를 제공해요.
Llama (2, 3.x, 4 series) meta-llama/Llama-4-Scout-17B-16E-Instruct Meta의 오픈 LLM 시리즈, 7B에서 400B 파라미터(Llama 2, 3, 새 Llama 4)로 잘 알려진 성능. SGLang은 Llama-4 모델별 최적화 제공
Mistral (Mixtral, NeMo, Small3) mistralai/Mistral-7B-Instruct-v0.2 강력한 성능을 가진 Mistral AI의 오픈 7B LLM; 더 큰 규모를 위해 MoE("Mixtral")와 NeMo Megatron 변형으로 확장.
Gemma (v1, v2, v3) google/gemma-3-1b-it Google의 효율적인 다국어 모델 패밀리(1B~27B); Gemma 3는 128K 컨텍스트 창을 제공하고 큰(4B+) 변형은 비전 입력 지원.
Phi (Phi-1.5, Phi-2, Phi-3, Phi-4, Phi-MoE series) microsoft/Phi-4-multimodal-instruct, microsoft/Phi-3.5-MoE-instruct Microsoft의 소형 모델 Phi 패밀리(1.3B~5.6B); Phi-4-multimodal(5.6B)은 텍스트, 이미지, 음성을 처리하고 Phi-4-mini는 고정확도 텍스트 모델, Phi-3.5-MoE는 mixture-of-experts 모델.
MiniCPM (v3, 4B) openbmb/MiniCPM3-4B 엣지 기기를 위한 OpenBMB의 컴팩트 LLM 시리즈; MiniCPM 3(4B)는 텍스트 작업에서 GPT-3.5급 결과 달성.
OLMo (2, 3) allenai/OLMo-3-1125-32B, allenai/OLMo-3-32B-Think, allenai/OLMo-2-1124-7B-Instruct 언어 모델의 과학을 가능하게 하도록 설계된 Allen AI의 Open Language Model 시리즈.
OLMoE (Open MoE) allenai/OLMoE-1B-7B-0924 Allen AI의 오픈 Mixture-of-Experts 모델(총 7B, 활성 1B 파라미터)로 희소 전문가 활성화로 최고 수준 결과.
MiniMax-M2 (M2, M2.1, M2.5) MiniMaxAI/MiniMax-M2.5, MiniMaxAI/MiniMax-M2.1, MiniMaxAI/MiniMax-M2 코딩 및 에이전트 워크플로우를 위한 MiniMax의 SOTA LLM.
StableLM (3B, 7B) stabilityai/stablelm-tuned-alpha-7b 일반 텍스트 생성을 위한 StabilityAI의 초기 오픈소스 LLM(3B & 7B); 기본적인 지시 따르기 능력을 가진 데모 모델.
Command-(R,A) (Cohere) CohereLabs/c4ai-command-r-v01, CohereLabs/c4ai-command-r7b-12-2024, CohereLabs/c4ai-command-a-03-2025 긴 컨텍스트, 검색 증강 생성, 도구 사용에 최적화된 Cohere의 오픈 대화 LLM(Command 시리즈).
DBRX (Databricks) databricks/dbrx-instruct 12T 토큰으로 훈련된 Databricks의 132B 파라미터 MoE 모델(36B 활성); 완전 오픈 파운데이션 모델로 GPT-3.5 품질과 경쟁.
Grok (xAI) xai-org/grok-1 거대한 크기(314B 파라미터)와 고품질로 알려진 xAI의 grok-1 모델; 고성능 추론을 위해 SGLang에 통합.
ChatGLM (GLM-130B family) THUDM/chatglm2-6b 중국어-영어 대화에 뛰어난 Zhipu AI의 이중 언어 채팅 모델(6B); 대화 품질과 정렬을 위해 파인튜닝.
InternLM 2 (7B, 20B) internlm/internlm2-7b SenseTime의 차세대 InternLM(7B와 20B), 강력한 추론과 초장기 컨텍스트 지원(최대 200K 토큰).
ExaONE 3 (한국어-영어) LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct 8T 토큰으로 훈련된 LG AI Research의 한국어-영어 모델(7.8B); 고품질 이중 언어 이해와 생성 제공.
Baichuan 2 (7B, 13B) baichuan-inc/Baichuan2-13B-Chat 개선된 성능과 오픈 상업 라이선스를 가진 BaichuanAI의 2세대 중국어-영어 LLM(7B/13B).
XVERSE (MoE) xverse/XVERSE-MoE-A36B 약 40개 언어를 지원하는 Yuanxiang의 오픈 MoE LLM(XVERSE-MoE-A36B: 총 255B, 활성 36B); 전문가 라우팅으로 100B+ 밀집 수준 성능 제공.
SmolLM (135M–1.7B) HuggingFaceTB/SmolLM-1.7B 놀랄 만큼 강력한 결과를 제공하는 Hugging Face의 초소형 LLM 시리즈(135M~1.7B 파라미터), 모바일/엣지 기기에서 고급 AI 가능하게 함.
GLM-4 (Multilingual 9B) ZhipuAI/glm-4-9b-chat Zhipu의 GLM-4 시리즈(최대 9B 파라미터) — 1M 토큰 컨텍스트와 5.6B 멀티모달 변형(Phi-4V)을 지원하는 오픈 다국어 모델.
MiMo (7B series) XiaomiMiMo/MiMo-7B-RL Xiaomi의 추론 최적화 모델 시리즈, Multiple-Token Prediction으로 더 빠른 추론 활용.
ERNIE-4.5 (4.5, 4.5MoE series) baidu/ERNIE-4.5-21B-A3B-PT Baidu의 ERNIE-4.5 시리즈. 47B 및 3B 활성 파라미터의 MoE로 구성되며 가장 큰 모델은 총 424B, 그리고 0.3B 밀집 모델도 있음.
Arcee AFM-4.5B arcee-ai/AFM-4.5B-Base 실제 세계 신뢰성과 엣지 배포를 위한 Arcee의 파운데이션 모델 시리즈.
Persimmon (8B) adept/persimmon-8b-chat 16K 컨텍스트 창과 빠른 추론을 가진 Adept의 오픈 8B 모델; Apache 2.0 라이선스.
Solar (10.7B) upstage/SOLAR-10.7B-Instruct-v1.0 지시 따르기 작업에 최적화된 Upstage의 10.7B 파라미터 모델. depth-up 스케일링 방법론을 통합해 성능 향상.
Tele FLM (52B-1T) CofeAI/Tele-FLM 520억 및 1조 파라미터 변형으로 제공되는 BAAI & TeleAI의 다국어 모델. ~2T 토큰으로 훈련된 디코더 전용 트랜스포머.
Ling (16.8B–290B) inclusionAI/Ling-lite, inclusionAI/Ling-plus InclusionAI의 오픈 MoE 모델. Ling-Lite는 총 16.8B / 활성 2.75B, Ling-Plus는 총 290B / 활성 28.8B. NLP와 복잡한 추론 작업에서 고성능 설계.
Granite 3.0, 3.1 (IBM) ibm-granite/granite-3.1-8b-instruct 추론, 코드, 비즈니스 AI 사용 사례에 최적화된 IBM의 오픈 밀집 파운데이션 모델. Red Hat 및 watsonx 시스템과 통합.
Granite 3.0, 3.1 MoE (IBM) ibm-granite/granite-3.0-3b-a800m-instruct, ibm-granite/granite-3.1-3b-a800m-instruct 강한 성능과 비용 효율을 제공하는 IBM의 Mixture-of-Experts 모델. 엔터프라이즈 대규모 배포용으로 설계된 MoE 전문가 라우팅. 3.1은 공유 전문가 추가.
GPT-J (6B) EleutherAI/gpt-j-6b Pile 데이터셋으로 훈련된 EleutherAI의 GPT-2 유사 인과 언어 모델(6B).
Orion (14B) OrionStarAI/Orion-14B-Base 중국어, 영어, 일본어, 한국어 등을 포함하는 2.5T 토큰 다국어 코퍼스로 사전 훈련된 OrionStarAI의 오픈소스 다국어 대규모 언어 모델 시리즈.
Llama Nemotron Super (v1, v1.5, NVIDIA) nvidia/Llama-3\_3-Nemotron-Super-49B-v1, nvidia/Llama-3\_3-Nemotron-Super-49B-v1\_5 NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델.
Llama Nemotron Ultra (v1, NVIDIA) nvidia/Llama-3_1-Nemotron-Ultra-253B-v1 NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델.
NVIDIA Nemotron Nano 2.0 nvidia/NVIDIA-Nemotron-Nano-9B-v2 NVIDIA Nemotron 패밀리 — 엔터프라이즈 지원 AI 에이전트를 위해 설계된 최고 수준 추론 모델. Nemotron-Nano-9B-v2는 추론 워크로드의 처리량을 높이면서 비슷한 크기 모델 대비 최고 수준 정확도를 달성하도록 설계된 하이브리드 Mamba-Transformer 언어 모델.
NVIDIA Nemotron 3 Super (NVIDIA) nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 NVIDIA Nemotron 3 Super는 120B 파라미터 MoE 모델(12B 활성)로 엔터프라이즈 AI 에이전트를 위한 고품질 추론과 생성을 제공.
NVIDIA Nemotron 3 Nano (NVIDIA) nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 NVIDIA Nemotron 3 Nano는 강력한 추론 능력을 가진 효율적인 엣지 및 엔터프라이즈 배포용 컴팩트 모델.
StarCoder2 (3B-15B) bigcode/starcoder2-7b 코드 생성과 이해에 특화된 오픈 대규모 언어 모델 패밀리. StarCoder의 후속으로 BigCode 프로젝트(Hugging Face, ServiceNow Research 등 협업)가 공동 개발.
Jet-Nemotron jet-ai/Jet-Nemotron-2B 최고 수준 오픈소스 전체 어텐션 언어 모델을 능가하면서 상당한 효율성 이득을 달성하는 하이브리드 아키텍처 언어 모델의 새 패밀리.
Trinity (Nano, Mini) arcee-ai/Trinity-Mini Apache 2.0 아래 오픈 가중치인 Arcee의 파운데이션 MoE Trinity 패밀리.
LFM2 (230M, 350M, 1.2B) LiquidAI/LFM2.5-1.2B-Instruct 소수의 grouped query attention(GQA) 블록과 결합된 게이트 단기 합성곱(gated short convolutions)을 결합한 Liquid AI의 하이브리드 언어 모델.
LFM2-MoE (8B-A1B, 24B-A2B) LiquidAI/LFM2-8B-A1B LFM2 하이브리드 백본의 Liquid AI 희소 Mixture-of-Experts 변형, SwiGLU 전문가, 정규화된 시그모이드 라우팅, top-k 전문가 선택 포함.
Falcon-H1 (0.5B–34B) tiiuae/Falcon-H1-34B-Instruct 효율적인 장기 컨텍스트 추론을 위해 어텐션과 상태 공간 모델을 결합한 TII의 하이브리드 Mamba-Transformer 아키텍처.
Mamba-Codestral (7B, Mamba2) mistralai/Mamba-Codestral-7B-v0.1 코드 생성을 위한 Mistral AI의 순수 Mamba2 상태 공간 모델; 어텐션 대신 선택적 상태 공간을 사용하므로 KV 캐시를 보유하지 않음.
Hunyuan-Large (389B, MoE) tencent/Tencent-Hunyuan-Large 총 389B / 활성 52B 파라미터의 Tencent 오픈소스 MoE 모델, Cross-Layer Attention(CLA)으로 효율성 개선.
IBM Granite 4.0 (Hybrid, Dense) ibm-granite/granite-4.0-h-micro, ibm-granite/granite-4.0-micro IBM Granite 4.0 micro 모델: 하이브리드 Mamba–MoE(h-micro)와 밀집(micro) 변형. 엔터프라이즈 중심 추론 모델.
Granite SWA (IBM) ibm-granite/granite-swash-2b 레이어별 슬라이딩 윈도우 어텐션과 학습 가능한 헤드별 어텐션 싱크를 가진 IBM Granite 밀집 모델. Granite 구현으로 서빙되며 transformers ≥ 5.15 필요.
Granite MoE SWA (IBM) ibm-granite/granite-swash-3b-a600m 레이어별 슬라이딩 윈도우 어텐션, 학습 가능한 어텐션 싱크, 선택적 공유 전문가를 가진 IBM Granite Mixture-of-Experts 모델. GraniteMoE 구현으로 서빙되며 transformers ≥ 5.15 필요.
Sarvam 2 (30B-A2B, 105B-A10B) sarvamai/sarvam-2 Sarvam의 Mixture-of-Experts 모델. 105B 변형은 MLA(Multi-head Latent Attention), 30B 변형은 GQA를 사용하며 둘 다 128개의 라우팅 전문가를 가짐.
Laguna XS.2 (poolside) poolside/Laguna-XS.2 Poolside의 하이브리드 슬라이딩-윈도우-어텐션 MoE 모델(라우팅 전문가 256개, 공유 전문가 1개, 시그모이드 라우터)로 레이어 유형별 RoPE(전체 어텐션 레이어에 YARN, 슬라이딩 어텐션 레이어에 기본값)와 softplus 헤드별 어텐션 게이트.
Mellum 2 (JetBrains) JetBrains/Mellum2-12B-A2.5B-Base, JetBrains/Mellum2-12B-A2.5B-Thinking 간헐적 슬라이딩-윈도우/전체 어텐션, 레이어 유형별 RoPE, 레이어별 밀집/희소 MLP 라우팅을 가진 JetBrains의 Qwen3-MoE 기반 코드 생성 모델.
GigaChat 3.5 ai-sage/GigaChat3.5-432B-A28B GigaChat의 하이브리드 MoE 모델: 레이어별 DeepSeek 스타일 MLA 전체 어텐션과 Qwen3 Gated-Delta-Net(GDN) 선형 어텐션 혼합, DeepSeek 스타일 라우팅 + 공유 전문가, 스큘래티브 디코딩용 다중 multi-token-prediction(MTP) 헤드. GCML 형식으로 도구 호출 생성.

더 알아보기