MiMo-V2.6
MiMo-V2.6
MiMo-V2.6-Flash는 Xiaomi가 개발한 오픈소스 파운데이션 모델이에요. Mixture-of-Experts 아키텍처가 총 309B 파라미터, 토큰당 15B 활성 파라미터를 갖고, 계산 효율을 위한 하이브리드 어텐션을 사용해요. 1M-토큰 컨텍스트 윈도우와 네이티브 멀티모달 기능을 지원하며, 많은 단계가 필요한 복잡한 작업을 포함한 코딩, 시각 이해, 범용 어시스턴트, 에이전트 워크플로 연구를 위해 설계됐어요.
MiMo-V2.6-Pro는 Xiaomi의 플래그십 파운데이션 모델로, 까다로운 워크로드를 위해 설계된 총 1.02T 파라미터, 토큰당 42B 활성 파라미터를 갖고 있어요. 역시 1M-토큰 컨텍스트 윈도우와 네이티브 멀티모달 기능을 지원하며, 코딩, 시각 이해, 범용 어시스턴스, 연구, 그리고 장기 수평 에이전트 작업을 강조해요.
출처: 문서
본문
1. 모델 소개
| Variant | Total parameters | Context window | Recipe (H200 / B300) |
|---|---|---|---|
| MiMo-V2.6-Flash | 309B (15B active) | 1M tokens | 4 GPUs, TP=EP=4 |
| MiMo-V2.6-Pro | 1.02T (42B active) | 1M tokens | 8 GPUs, TP=EP=8 |
라이선스: MIT이며, 모델 팀이 확인한 MiMo-V2.5 라이선스를 이어가요.
아키텍처 참고: MiMo-V2.6-Flash-RL 및 MiMo-V2.6-Pro-RL 모델 카드가 이 세대를 직접 문서화해요 — 하이브리드 슬라이딩-윈도우/글로벌 어텐션 백본, 옴니모달 인코더, 발표된 평가 점수, 그리고 각 저장소에는 MiMo-V2.6 기술 보고서도 실려 있어요. 두 체크포인트 모두 config.json에서 store_dtype: mxfp4와 함께 moe_router_dtype: bfloat16을 선언하는데, 이는 이 레시피들이 의존하는 expert 전용 MXFP4 양자화와 BF16 라우팅이에요. 둘 다 각자의 dflash/ 하위 디렉터리에 짝을 이루는 DFlash drafter도 함께 실어요.
2. 구성 팁
병렬성과 정밀도
- Flash:
--tp 4 --ep 4; Pro:--tp 8 --ep 8. 둘 다--dp 1 --pp-size 1을 유지해요. TP와 EP는 같은 GPU 랭크를 사용하므로, GPU 수를 구하려고 곱하지 마세요. - MoE 계산과 통신: B300에서는
--moe-runner-backend deep_gemm을, H200에서는--moe-runner-backend marlin을 유지하고,--moe-a2a-backend deepep --deepep-mode auto를--moe-dense-tp-size 1및--enable-dp-lm-head와 함께 사용하세요 (PR에서처럼). - 정밀도: MXFP4는 전체 모델이 아니라 MoE expert 가중치를 나타내요. BF16 라우터 가중치는 체크포인트의
moe_router_dtype에 따라 선택되고, 지원 커밋은 라우터 출력 로짓을 FP32로 계산해요. PR은 체크포인트 양자화 메타데이터에 의존하며--quantization오버라이드를 추가하지 않아요. - 어텐션: H200과 B300 모두에서
--attention-backend fa4와--mm-attention-backend fa4를 유지하세요. 레시피는 또한 멀티모달 인코딩을 위해--mm-enable-dp-encoder를 활성화해요.
컨텍스트 길이와 메모리
두 명령 모두 --context-length 1048576을 설정해요. 이는 구성된 요청당 컨텍스트 제한이며, 64개의 동시 1M-토큰 요청이 메모리에 들어맞는다는 뜻은 아니에요.
Flash는 --mem-fraction-static 0.6 --swa-full-tokens-ratio 0.03을 사용하고, Pro는 --mem-fraction-static 0.7 --swa-full-tokens-ratio 0.08을 사용해요. 메모리 비율은 가중치와 KV 캐시를 예산 책정하고, SWA 비율은 슬라이딩-윈도우 대비 전체-어텐션 KV 할당을 제어해요. 베이스 레시피에는 이 모델별 값을 보존하세요.
공유 prefill 설정은 --chunked-prefill-size 49152 --max-prefill-tokens 65536이에요. 두 명령 모두 실행 중인 요청과 decode CUDA-graph 배치 크기를 64로 제한하고, prefill CUDA 그래프를 비활성화하며, 페이지 크기 1을 사용해요. --enable-cache-report와 --log-level-http warning은 PR의 보고 설정을 유지해요.
DFlash와 캐싱
베이스 레시피는 --speculative-algorithm DFLASH --speculative-num-draft-tokens 8을 사용해요. 선택한 타겟 모델과 짝을 이루는 DFlash 체크포인트를 제공하세요. 드래프트 경로는 독립적으로 편집할 수 있으며 타겟 체크포인트의 하위 디렉터리일 필요는 없어요.
고정 커밋에서 NVIDIA GPU의 DFlash는 PP=1을 요구하고 DP-attention을 거부해요. --enable-dp-attention을 추가하거나 V2.5 쿡북에서 EAGLE 전용 설정을 복사하지 마세요.
3. 추론과 툴 호출
두 실행 명령 모두 --reasoning-parser mimo --tool-call-parser mimo를 활성화해요. MiMo reasoning 파서는 요청의 chat_template_kwargs.enable_thinking 설정을 사용해요: 추론에는 true로, 직접 답변에는 false로 설정하세요. 명령 패널의 cURL 예제는 추론을 명시적으로 활성화해요.
OpenAI 호환 클라이언트의 경우, 추론은 choices[0].message.reasoning_content에서, 최종 답변은 choices[0].message.content에서, 구조화된 툴 요청은 choices[0].message.tool_calls에서 읽어요. 응답을 검사할 때 추론과 답변 필드를 모두 보존하세요. 애플리케이션이 명시적 샘플링 설정을 필요로 하지 않는 한 체크포인트의 생성 기본값을 사용하세요.
V2.6의 런타임 처리량, 지연 시간, 정확도, 예제 응답은 이 체크포인트들의 측정값이 나오면 추가될 거예요.