DeepSeek-V3 — 671B MoE와 MTP

DeepSeek-V3

DeepSeek-V3는 총 671B 파라미터지만 토큰마다 37B만 활성화되는 강력한 MoE 언어 모델이에요. 희소 활성화 덕분에 전체 크기 대비 계산이 훨씬 가벼워요.

아키텍처 특징

  • 총 671B / 활성 37B — MoE 구조로 희소 활성화.
  • GQA(Grouped Query Attention)num_key_value_heads를 적게 두어 메모리 절약.
  • MTP(Multi-Token Prediction)num_mtp_layers로 기본 디코더 뒤에 붙여 한 번에 여러 토큰 예측.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
    "deepseek-ai/DeepSeek-V3",
    device_map="auto",
    quantization_config=FineGrainedFP8Config(dequantize=True),
    experts_implementation="deepgemm",
)

왜 주목받나

큰 모델을 '파라미터 수만큼 비싸게' 쓰지 않고, 활성 파라미터만큼만 계산하게 해서 비용을 낮춰요. DeepSeek 담당 구성(num_hidden_layers, num_attention_heads 등)이 Transformers에서 전용 config로 제공돼요.

더 알아보기