Mixtral — 토큰당 2개 전문가 라우팅

Mixtral

Mixtral-8x7B는 오픈웨이트 희소 MoE(sparse MoE) 모델로, MLP 레이어마다 8개의 전문가를 두고 토큰을 top-2 라우팅으로 2개 전문가에게만 보내요. 총 45B 파라미터지만, 단일 순방향 계산량은 14B 모델과 같아요.

핵심 아이디어

  • 8 experts per MLP, 총 45B 파라미터.
  • 각 토큰이 hidden state로 2번(top-2)만 디스패치되므로, 계산은 시퀀스 길이의 2배 수준.
  • Llama 2 70B보다 대부분 벤치마크에서 우수하면서 추론은 6배 빠르다고 보고돼요.

공유하는 세부 사항

Mistral-7B와 공유하는 설계:

  • Sliding Window Attention: 8K 컨텍스트로 학습하지만 이론상 128K 주의 범위.
  • GQA: 추론을 빠르게 하고 캐시 크기를 줄임.
  • Byte-fallback BPE tokenizer: OOV 문자 방지.
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("mistralai/Mixtral-8x7B-v0.1")

왜 중요한가

MoE가 '크지만 계산은 작은' 모델을 실전에서 가능하게 한다는 걸 보여준 대표 사례예요. 이후 많은 MoE 모델의 기준이 됐어요.

더 알아보기