Mixtral 모델 — 8x7B와 Instruct
Mixtral 모델
Mixtral 8x7B가 오픈웨이트로 배포되면서 그에 맞춰 Mixtral 8x7B Instruct도 함께 공개됐어요. 두 모델 모두 Apache 2.0 라이선스예요.
Mixtral 8x7B (base)
- 희소 MoE, 총 46.7B / 활성 12.9B 파라미터
- 대부분의 벤치마크에서 Llama 2 70B와 동급 이상, GPT3.5와 동급 이상
- GPT3.5보다 6배 빠른 추론
- 허용적 라이선스를 가진 가장 강력한 오픈웨이트 모델
Mixtral 8x7B Instruct
- 지도 파인튜닝(SFT) + DPO(Direct Preference Optimization)로 최적화
- MT-Bench에서 8.30 점수 — 당시 최고 오픈소스 모델, GPT3.5와 유사
- 바람직하지 않은 출력을 막는 가이드라인 프롬프트로 일부 필터링 가능
배포 스택
Mistral은 vLLM 프로젝트에 Megablocks CUDA 커널 통합 변경을 제출해 완전 오픈소스 스택으로 Mixtral을 실행할 수 있게 했어요. Skypilot으로 어떤 클라우드 인스턴스에든 vLLM 엔드포인트를 배포할 수 있어요.