Mixtral 배포와 성능 — vLLM과 벤치마크
Mixtral 배포와 성능
Mixtral을 셀프호스팅할 때는 vLLM과 Megablocks CUDA 커널을 쓰는 것이 정석이에요. vLLM의 Megablocks 통합 덕분에 희소 MoE의 expert parallelism을 효율적으로 처리할 수 있어요.
성능 관점
- 토큰당 12.9B 파라미터만 사용 → 12.9B 모델과 같은 속도·비용으로 46.7B급 품질
- Llama 2 70B보다 6배 빠른 추론
- MMLU·수학·코드 등 대부분 벤치마크에서 Llama 2 70B·GPT3.5 동급 이상
- 품질 대비 추론 예산(비용) 트레이드오프가 매우 효율적
배포 흐름
- vLLM이 통합된 서빙 스택 구성 (Megablocks CUDA 커널 사용)
- Skypilot으로 클라우드 인스턴스에 vLLM 엔드포인트 배포
- Mistral 플랫폼의
mistral-small엔드포인트로도 접근 가능