DeepSeek-V3 아키텍처 — MLA·DeepSeekMoE·FP8·MTP

DeepSeek-V3 아키텍처

DeepSeek-V3는 직전 버전(V2)에서 검증된 효율적 구조 위에 몇 가지 혁신을 얹은 모델이에요. 한 줄로 요약하면, 효율적인 MoE 구조 + 부하 분산 최적화 + 멀티토큰 예측 + FP8 혼합 정밀도 훈련이에요.

핵심 아키텍처 요소

  • Multi-head Latent Attention(MLA) — 추론 메모리를 줄이는 효율적 어텐션
  • DeepSeekMoE — 희소 전문가 구조
  • Auxiliary-loss-free 전략 — 부하 분산을 장려하면서 성능 저하를 최소화
  • Multi-Token Prediction(MTP) — 한 번에 여러 토큰을 예측해 성능을 높이고, **추측 디코딩(speculative decoding)**으로 추론 가속에도 활용

훈련 효율

  • FP8 혼합 정밀도 훈련 프레임워크 — 극대규모 모델에서 FP8 훈련의 실현 가능성을 처음 검증
  • 알고리즘·프레임워크·하드웨어 공동 설계로 통신 병목 극복, 거의 완전한 계산-통신 중첩 달성
  • 전체 훈련에 2.788M H800 GPU 시간만 소요 (사전 훈련 2.664M + 이후 단계 약 0.1M)
  • 훈련 과정이 매우 안정적 — 복구 불가능한 loss spike나 롤백이 전혀 없었어요

더 알아보기