Mixtral 모델 — 8x7B와 Instruct

Mixtral 모델

Mixtral 8x7B가 오픈웨이트로 배포되면서 그에 맞춰 Mixtral 8x7B Instruct도 함께 공개됐어요. 두 모델 모두 Apache 2.0 라이선스예요.

Mixtral 8x7B (base)

  • 희소 MoE, 총 46.7B / 활성 12.9B 파라미터
  • 대부분의 벤치마크에서 Llama 2 70B와 동급 이상, GPT3.5와 동급 이상
  • GPT3.5보다 6배 빠른 추론
  • 허용적 라이선스를 가진 가장 강력한 오픈웨이트 모델

Mixtral 8x7B Instruct

  • 지도 파인튜닝(SFT) + DPO(Direct Preference Optimization)로 최적화
  • MT-Bench에서 8.30 점수 — 당시 최고 오픈소스 모델, GPT3.5와 유사
  • 바람직하지 않은 출력을 막는 가이드라인 프롬프트로 일부 필터링 가능

배포 스택

Mistral은 vLLM 프로젝트에 Megablocks CUDA 커널 통합 변경을 제출해 완전 오픈소스 스택으로 Mixtral을 실행할 수 있게 했어요. Skypilot으로 어떤 클라우드 인스턴스에든 vLLM 엔드포인트를 배포할 수 있어요.

더 알아보기