Sparse MoE 가이드 — Mistral이 MoE를 쓰는 이유
Sparse MoE 가이드 — Mistral이 MoE를 쓰는 이유
Mistral이 잘 알려진 이유 중 하나는 Sparse MoE(Mixture of Experts, 전문가 혼합) 구조를 실제 모델에 효과적으로 적용한 데 있어요. 모든 파라미터를 항상 쓰는 대신, 입력마다 일부 전문가(expert)만 활성화해 연산 효율을 높이는 방식이에요.
일반적인 덴스(dense) 모델은 모든 레이어의 파라미터를 모든 입력에 적용해요. 반면 MoE 는 레이어 안에 여러 전문가를 두고, 라우터(routing)가 입력 토큰을 적절한 전문가 몇 개에만 보내요. 이렇게 하면 총 파라미터는 많아도, 실제 추론 당시 쓰는 연산(FLOPs)은 줄어들어서 효율적이에요.
Mistral MoE 모델은 이 희소 구조로 두 가지 장점을 노려요:
- 효율성: 모든 전문가를 동시에 돌리지 않아 추론 비용이 낮아져요.
- 용량: 전체 파라미터 수는 늘려 지식과 능력은 키우면서 연산은 유지해요.
moe 라는 슬러그에서도 보이듯, Mistral 초기 모델(Mistral 7B 계열의 8x7B MoE 등)이 이 구조를 대중화하는 데 큰 역할을 했어요. 이후 Mistral 연구와 모델 계열에서 MoE는 핵심 설계 원칙으로 자리잡았어요.
참고: MoE 구조는 효율성을 주지만, 라우팅과 메모리 배치가 복잡해서 배포 시 전문가 병렬(EP) 같은 기법과 함께 고려해야 해요.