MiMo-V2 — MoE 架构下的高效推理与智能体旗舰家族
MiMo-V2
Section titled “MiMo-V2”发布日期: 2025-12-16(V2-Flash 开源),2026-03-18(V2-Pro / V2-Omni)
来源: arXiv 2601.02780, mimo.mi.com
工程范式: MoE 路由 + 混合注意力 + 多教师在线蒸馏(MOPD)。
MiMo-V2 是小米 LLM-Core 团队的第二代模型家族,从 MiMo-7B(Dense 架构)全面转向 MoE 架构。V2 系列的核心目标是在推理成本、速度和能力之间找到最优平衡。
V2 系列包含三个版本:
| 模型 | 总参数 | 激活参数 | 架构 | 上下文 | 许可 |
|---|---|---|---|---|---|
| V2-Flash | 309B | 15B | MoE + 混合 SWA | 256K | MIT |
| V2-Pro | 1T | 42B | MoE | 长上下文 | 专有 |
| V2-Omni | 未知 | 未知 | 多模态 MoE | - | 专有 |
核心理念:以极低成本提供顶级性能——V2-Flash 的推理成本仅 Claude 4.5 Sonnet 的 2.5%,速度是其 2 倍。
关键架构决策
Section titled “关键架构决策”V2-Flash 架构
Section titled “V2-Flash 架构”1. 混合注意力(Hybrid SWA + Global Attention)
- SWA:GA 比例 = 5:1(每 5 层 SWA 接 1 层 Global Attention)
- SWA 窗口仅 128 tokens(激进压缩)
- Attention Sink Bias(可学习)——在激进窗口下维持长上下文性能
- 相比全注意力:KV Cache 减少 ~6×,注意力计算减少 ~6×
2. Multi-Token Prediction (MTP)
- 预训练时使用 MTP 辅助训练,强化模型能力
- 推理时 MTP 作为 投机解码的草稿模型
- 3 层 MTP 达到 2.5×-3.7× 实际推理加速
- 接受长度最高 3.6(MTP 3 层)
3. 预训练
- 27T tokens 预训练数据
- 原生 32K 上下文,扩展至 256K
- MIT 协议开源
MOPD(Multi-Teacher On-Policy Distillation)
Section titled “MOPD(Multi-Teacher On-Policy Distillation)”V2-Flash 后训练的核心创新:
- 阶段 1:通用 SFT(监督微调)
- 阶段 2:领域专家 RL(数学、代码、智能体分别训练专家模型)
- 阶段 3:学生模型 MOPD(从多个领域专家模型蒸馏到一个模型)
- 解决了传统模型合并中的能力互斥问题
R3(Rollout Routing Replay)
Section titled “R3(Rollout Routing Replay)”- 解决 MoE 在 RL 训练中的路由不一致问题
- 保证专家路由的稳定性和可预测性
- 支持大规模 Agent 训练的仿真环境
- 混合精度训练
V2-Flash 基准性能
Section titled “V2-Flash 基准性能”| 基准 | MiMo-V2-Flash | DeepSeek-V3.2 | Claude Sonnet 4.5 |
|---|---|---|---|
| SWE-Bench Verified | ~73% | ~73-75% | - |
| AIME25 | ~80-86% | - | - |
| GPQA-Diamond | ~80-87% | - | - |
| Arena-Hard | 强 | 竞争性 | 竞争性 |
- SWE-Bench 接近 DeepSeek-V3.2 水平
- 智能体基准排名开源第二
- 代码能力超越所有开源模型,接近 Claude 4.5 Sonnet
成本-速度优势
Section titled “成本-速度优势”| 指标 | V2-Flash | Claude 4.5 Sonnet | DeepSeek-V3.2 |
|---|---|---|---|
| 推理成本 | $0.1/M in, $0.3/M out | ~$15/M in, ~$75/M out | - |
| 速度比 | 2× Claude | 1× | - |
| 成本比 | 2.5% 的 Claude | 100% | - |
V2-Pro 定位
Section titled “V2-Pro 定位”- 1T 总参数 / 42B 激活参数
- 面向智能体工作负载的前沿模型
- 代码能力和智能体场景达到 Claude Opus 级别
- 在 Hunter Alpha 排行榜上进入全球前列
| 维度 | MiMo-7B (V1) | MiMo-V2-Flash | MiMo-V2-Pro |
|---|---|---|---|
| 架构 | Dense | MoE (309B/15B) | MoE (1T/42B) |
| 上下文 | 32K | 256K | 长上下文 |
| 注意力 | 标准 | Hybrid SWA 5:1 | - |
| MTP | 1 层 (预训练) | 3 层 (推理加速) | - |
| 后训练 | GRPO | MOPD | MOPD |
| 开源 | MIT | MIT | 专有 |
可复用的工程经验
Section titled “可复用的工程经验”- 5:1 混合 SWA 架构是 MoE 模型实现长上下文效率的关键——6× KV Cache 减少对推理成本影响巨大。
- Attention Sink Bias 是小窗口 SWA 的必备组件——在 128 token 窗口下维持长上下文性能的关键。
- MTP 的双重用途:训练时辅助学习 + 推理时投机解码加速,是”一次投资、两处收益”的经典设计。
- MOPD 解决了”全能模型”训练中的关键问题——多个专家模型的知识如何无损合并。
- R3 路由重放是 MoE + RL 架构中路由稳定性的工程诀窍。
- MIT 许可下的 309B 开源——小米在参数规模和开放程度之间做了务实选择。
- 开源旗舰(V2-Flash)与闭源旗舰(V2-Pro)的分层策略——社区获取效率,企业获取性能。