MiMo-V2-Flash
MiMo-V2-Flash
XiaomiMiMo/MiMo-V2-Flash는 총 309B 파라미터, 활성 15B 파라미터를 가진 추론 중심 모델로, 실세계 서빙 워크로드를 위해 설계되어 하드웨어에 따라 처리량과 지연 시간 사이에서 유연한 트레이드오프를 제공해요. 하이브리드 어텐션 아키텍처(SWA/GA 5:1 비율, 128-token 윈도우)로 KV-cache를 약 6배 줄이고, 경량 MTP 모듈(블록당 0.33B 파라미터)로 출력 속도를 3배 높여요.
27T 토큰 FP8 혼합 정밀도·네이티브 32k 시퀀스 길이로 사전 훈련했고 컨텍스트 윈도우는 최대 256k를 지원해요. 에이전트 기능을 위해 MOPD와 대규모 에이전트 RL을 사용하며 SWE-Bench와 복잡한 추론 작업에서 우수한 성능을 보여요.
출처: 문서
본문
Introduction
XiaomiMiMo/MiMo-V2-Flash는 총 309B 파라미터, 활성 15B 파라미터를 가진 새로운 추론 중심 모델이에요. XiaomiMiMo 팀이 실세계 서빙 워크로드를 위해 명시적으로 공동 설계해 디코딩 효율을 최대화하며, 하드웨어에 따라 처리량과 지연 시간 사이에서 유연한 트레이드오프를 제공해요.
이 모델은 장문 컨텍스트 모델링 능력과 추론 효율 사이에 새로운 균형을 만들어요. 주요 특징:
- 하이브리드 어텐션 아키텍처: Sliding Window Attention (SWA)과 Global Attention (GA)을 5:1 비율로 교차 배치하고 공격적인 128-token 윈도우를 사용해요. 학습 가능한 attention sink bias로 장문 컨텍스트 성능을 유지하면서 KV-cache 저장을 거의 6배 줄여요.
- Multi-Token Prediction (MTP): dense FFN을 사용하는 경량 MTP 모듈(블록당 0.33B 파라미터)을 장착했어요. 추론 중 출력 속도를 3배 높이며 RL 훈련에서 rollout 가속에도 유용해요.
- 효율적인 사전 훈련: FP8 혼합 정밀도와 네이티브 32k 시퀀스 길이로 27T 토큰으로 훈련했어요. 컨텍스트 윈도우는 최대 256k 길이를 지원해요.
- 에이전트 기능: 사후 훈련에서 Multi-Teacher On-Policy Distillation (MOPD)과 대규모 에이전트 RL을 사용해 SWE-Bench와 복잡한 추론 작업에서 우수한 성능을 달성해요.
Installation
MiMo-V2-Flash는 현재 Docker 이미지와 pip 설치로 SGLang에서 사용할 수 있어요.
Docker
# Pull the docker image
docker pull lmsysorg/sglang:latest
# Launch the container
docker run -it --gpus all \
--shm-size=32g \
--ipc=host \
--network=host \
lmsysorg/sglang:latest bash
Pip 설치
# On a machine with SGLang dependencies installed or inside a SGLang nightly container
# Start an SGLang nightly container
docker run -it --gpus all \
--shm-size=32g \
--ipc=host \
--network=host \
lmsysorg/sglang:latest bash
# If you already have SGLang installed, uninstall the current SGLang version
pip uninstall sglang -y
# Install the PyPI Package
pip install sglang==0.5.6.post2.dev8005+pr.15207.g39d5bd57a \
--extra-index-url https://sgl-project.github.io/whl/pr/
Model Deployment
아래 구성 선택기를 사용해 적절한 배포 명령을 자동 생성하세요.
선택기에서 MI355X (ROCm)은 --tp-size 4, Triton attention, --disable-custom-all-reduce로 검증됐어요. 검증 중 --tp-size 8은 QKV 샤딩 오류가 발생했어요. EAGLE 추측 디코딩은 MI355X에서 아직 WIP예요.
배포 테스트
서버가 실행되면 다른 터미널에서 채팅 완료 요청으로 테스트하세요:
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "XiaomiMiMo/MiMo-V2-Flash",
"messages": [
{"role": "user", "content": "Hello! What can you help me with?"}
],
"temperature": 0.7,
"max_tokens": 100
}'
예상 응답:
{
"id": "...",
"object": "chat.completion",
"model": "XiaomiMiMo/MiMo-V2-Flash",
"choices": [{
"message": {
"role": "assistant",
"content": "Hello! I can help you with..."
}
}]
}
Troubleshooting
DeepGEMM 타임아웃 오류
첫 실행 중 가끔 DeepGEMM 타임아웃 오류가 발생해요. 같은 컨테이너에서 서버 명령을 다시 실행하면 돼요. 컴파일된 커널이 캐시되어 이후 실행은 빨라요.
ROCm MI355X 어텐션 백엔드
MI355X에서 AiterAttnBackend.forward_decode() got an unexpected keyword argument 'sinks' 같은 오류가 보이면, 위 선택기의 MI355X + Performance Optimizations 명령을 사용하세요. 이 명령은 Triton attention으로 전환하고 --disable-custom-all-reduce를 유지해요.