DeepSeek-V3 — 671B MoE와 MTP
DeepSeek-V3
DeepSeek-V3는 총 671B 파라미터지만 토큰마다 37B만 활성화되는 강력한 MoE 언어 모델이에요. 희소 활성화 덕분에 전체 크기 대비 계산이 훨씬 가벼워요.
아키텍처 특징
- 총 671B / 활성 37B — MoE 구조로 희소 활성화.
- GQA(Grouped Query Attention) —
num_key_value_heads를 적게 두어 메모리 절약. - MTP(Multi-Token Prediction) —
num_mtp_layers로 기본 디코더 뒤에 붙여 한 번에 여러 토큰 예측.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"deepseek-ai/DeepSeek-V3",
device_map="auto",
quantization_config=FineGrainedFP8Config(dequantize=True),
experts_implementation="deepgemm",
)
왜 주목받나
큰 모델을 '파라미터 수만큼 비싸게' 쓰지 않고, 활성 파라미터만큼만 계산하게 해서 비용을 낮춰요. DeepSeek 담당 구성(num_hidden_layers, num_attention_heads 등)이 Transformers에서 전용 config로 제공돼요.