跳转到内容

MiMo-V2 — MoE 架构下的高效推理与智能体旗舰家族

发布日期: 2025-12-16(V2-Flash 开源),2026-03-18(V2-Pro / V2-Omni)
来源: arXiv 2601.02780, mimo.mi.com
工程范式: MoE 路由 + 混合注意力 + 多教师在线蒸馏(MOPD)。

MiMo-V2 是小米 LLM-Core 团队的第二代模型家族,从 MiMo-7B(Dense 架构)全面转向 MoE 架构。V2 系列的核心目标是在推理成本、速度和能力之间找到最优平衡。

V2 系列包含三个版本:

模型总参数激活参数架构上下文许可
V2-Flash309B15BMoE + 混合 SWA256KMIT
V2-Pro1T42BMoE长上下文专有
V2-Omni未知未知多模态 MoE-专有

核心理念:以极低成本提供顶级性能——V2-Flash 的推理成本仅 Claude 4.5 Sonnet 的 2.5%,速度是其 2 倍。

1. 混合注意力(Hybrid SWA + Global Attention)

  • SWA:GA 比例 = 5:1(每 5 层 SWA 接 1 层 Global Attention)
  • SWA 窗口仅 128 tokens(激进压缩)
  • Attention Sink Bias(可学习)——在激进窗口下维持长上下文性能
  • 相比全注意力:KV Cache 减少 ~6×,注意力计算减少 ~6×

2. Multi-Token Prediction (MTP)

  • 预训练时使用 MTP 辅助训练,强化模型能力
  • 推理时 MTP 作为 投机解码的草稿模型
  • 3 层 MTP 达到 2.5×-3.7× 实际推理加速
  • 接受长度最高 3.6(MTP 3 层)

3. 预训练

  • 27T tokens 预训练数据
  • 原生 32K 上下文,扩展至 256K
  • MIT 协议开源

MOPD(Multi-Teacher On-Policy Distillation)

Section titled “MOPD(Multi-Teacher On-Policy Distillation)”

V2-Flash 后训练的核心创新:

  • 阶段 1:通用 SFT(监督微调)
  • 阶段 2:领域专家 RL(数学、代码、智能体分别训练专家模型)
  • 阶段 3:学生模型 MOPD(从多个领域专家模型蒸馏到一个模型)
  • 解决了传统模型合并中的能力互斥问题
  • 解决 MoE 在 RL 训练中的路由不一致问题
  • 保证专家路由的稳定性和可预测性
  • 支持大规模 Agent 训练的仿真环境
  • 混合精度训练
基准MiMo-V2-FlashDeepSeek-V3.2Claude Sonnet 4.5
SWE-Bench Verified~73%~73-75%-
AIME25~80-86%--
GPQA-Diamond~80-87%--
Arena-Hard竞争性竞争性
  • SWE-Bench 接近 DeepSeek-V3.2 水平
  • 智能体基准排名开源第二
  • 代码能力超越所有开源模型,接近 Claude 4.5 Sonnet
指标V2-FlashClaude 4.5 SonnetDeepSeek-V3.2
推理成本$0.1/M in, $0.3/M out~$15/M in, ~$75/M out-
速度比2× Claude-
成本比2.5% 的 Claude100%-
  • 1T 总参数 / 42B 激活参数
  • 面向智能体工作负载的前沿模型
  • 代码能力和智能体场景达到 Claude Opus 级别
  • 在 Hunter Alpha 排行榜上进入全球前列
维度MiMo-7B (V1)MiMo-V2-FlashMiMo-V2-Pro
架构DenseMoE (309B/15B)MoE (1T/42B)
上下文32K256K长上下文
注意力标准Hybrid SWA 5:1-
MTP1 层 (预训练)3 层 (推理加速)-
后训练GRPOMOPDMOPD
开源MITMIT专有
  1. 5:1 混合 SWA 架构是 MoE 模型实现长上下文效率的关键——6× KV Cache 减少对推理成本影响巨大。
  2. Attention Sink Bias 是小窗口 SWA 的必备组件——在 128 token 窗口下维持长上下文性能的关键。
  3. MTP 的双重用途:训练时辅助学习 + 推理时投机解码加速,是”一次投资、两处收益”的经典设计。
  4. MOPD 解决了”全能模型”训练中的关键问题——多个专家模型的知识如何无损合并。
  5. R3 路由重放是 MoE + RL 架构中路由稳定性的工程诀窍。
  6. MIT 许可下的 309B 开源——小米在参数规模和开放程度之间做了务实选择。
  7. 开源旗舰(V2-Flash)与闭源旗舰(V2-Pro)的分层策略——社区获取效率,企业获取性能。