Mixture of Experts — 라우터가 전문가를 고르는 희소 구조

Mixture of Experts

모델이 커지면 모든 파라미터를 매번 계산해야 해서 비용이 급증해요. **MoE(Mixture of Experts)**는 여러 '전문가' 모듈을 두고, 각 토큰을 라우터가 필요한 소수 전문가로만 보내 희소(sparse)하게 계산하는 구조예요. 전체 파라미터는 많지만 활성화되는 양은 적어서, 큰 모델을 효율적으로 돌릴 수 있어요.

이 카테고리의 문서

  • 핵심 기능: Experts Backends — 전문가 행렬 곱 최적 백엔드
  • 사례: DeepSeek-V3 — 671B MoE와 MTP
  • 사례: Mixtral — 토큰당 2개 전문가 라우팅

출처: https://huggingface.co/docs/transformers/en/experts_interface