Mixtral 배포와 성능 — vLLM과 벤치마크

Mixtral 배포와 성능

Mixtral을 셀프호스팅할 때는 vLLM과 Megablocks CUDA 커널을 쓰는 것이 정석이에요. vLLM의 Megablocks 통합 덕분에 희소 MoE의 expert parallelism을 효율적으로 처리할 수 있어요.

성능 관점

  • 토큰당 12.9B 파라미터만 사용 → 12.9B 모델과 같은 속도·비용으로 46.7B급 품질
  • Llama 2 70B보다 6배 빠른 추론
  • MMLU·수학·코드 등 대부분 벤치마크에서 Llama 2 70B·GPT3.5 동급 이상
  • 품질 대비 추론 예산(비용) 트레이드오프가 매우 효율적

배포 흐름

  1. vLLM이 통합된 서빙 스택 구성 (Megablocks CUDA 커널 사용)
  2. Skypilot으로 클라우드 인스턴스에 vLLM 엔드포인트 배포
  3. Mistral 플랫폼의 mistral-small 엔드포인트로도 접근 가능

더 알아보기