DeepSeek-V3 — MoE 기반 거대 오픈 모델

DeepSeek-V3

DeepSeek-V3는 671B 총 파라미터, 토큰당 37B 활성의 Mixture-of-Experts(MoE) 언어 모델이에요. 효율적인 추론·저비용 훈련을 위해 **Multi-head Latent Attention(MLA)**과 DeepSeekMoE 아키텍처를 쓰고, 부하 분산을 위한 auxiliary-loss-free 전략멀티토큰 예측 목적을 채택했어요. 14.8T 토큰으로 사전 훈련한 뒤 SFT·RL 단계를 거쳤어요.

이 카테고리의 문서

  • 아키텍처와 훈련: MLA·DeepSeekMoE·FP8·MTP
  • 모델 다운로드: 체크포인트와 사용
  • 실행과 API: 로컬 실행·API 플랫폼

출처: https://github.com/deepseek-ai/DeepSeek-V3