跳转到内容

MiMo-V2.5 — 小米全模态 Agent 模型的开源突围

发布日期: 2026-04-22 来源: Xiaomi MiMo 官方产品页 / 模型发布日志 工程范式: 原生全模态 Agent 统一模型路线——在单一 MoE 架构中集成视觉+音频理解,通过五阶段训练渐进扩展上下文至 1M。

注意: 截至目前(2026-07-14),小米未发布 MiMo-V2.5 的正式 arxiv 技术报告。以下分析基于官方产品页面和模型发布日志,部分架构细节来自公共信息。

小米 MiMo 团队的核心约束是在开源许可下交付有竞争力的全模态 Agent 模型。V2.5 的设计选择体现了三条原则:

  1. 全模态原生整合而非拼接——视觉和音频编码器与语言骨干在训练中深度对齐,而非简单地在推理时拼接。通过 projector warmup → 多模态预训练 → RL/MOPD 的五阶段管线,确保各模态在模型中作为一等公民。
  2. Agent 能力作为训练目标而非事后补丁——从文本预训练到 RL 阶段,Agent 任务(工具调用、多步推理、环境交互)是贯穿始终的设计约束,不是最后加上的 API 层。
  3. 规模效率优先于参数堆叠——310B 总参 / 15B 激活的稠密-稀疏比(20.7:1),搭配 48T token 训练,在不牺牲推理效率的前提下达到竞争性能力。
配置总参激活参上下文精度
MiMo-V2.5-Base310B15B256KFP8 (E4M3) Mixed
MiMo-V2.5310B15B1MFP8 (E4M3) Mixed
MiMo-V2.5-Pro~1T42B1M未公开
  • 继承 MiMo-V2-Flash 的混合注意力架构(滑动窗口 + 全局注意力,5:1 比例,128-token 窗口)
  • Sparse MoE(激活 15B / 总 310B)
  • MTP(Multi-Token Prediction)在训练和推理中复用——训练时做预测头,推理时用作投机解码的 draft 模型
  • 原生 32K 上下文,通过渐进式训练扩展到 256K(Base)和 1M(Chat)
  • 视觉编码器: 自研视觉编码器,通过轻量级 projector 连接至语言骨干
  • 音频编码器: 自研音频编码器,通过独立 projector 连接
  • 两编码器均在内部数据上预训练,而非使用现成开源组件
  • 五个训练阶段中,前三个阶段专门用于模态对齐:
    1. 文本预训练(构建 LLM 骨干)
    2. Projector warming(对齐视觉/音频 projector)
    3. 多模态预训练(大规模跨模态数据)
    4. SFT + Agentic Post-training(渐进式上下文扩展从 32K → 256K → 1M)
    5. RL + MOPD(强化感知、推理和 Agent 能力)

MOPD(Multi-Teacher On-Policy Distillation)

Section titled “MOPD(Multi-Teacher On-Policy Distillation)”

详见 V2-Flash 报告中已有介绍。V2.5 将 MOPD 扩展到多模态场景——在 RL 阶段使用多个教师模型(视觉、音频、文本)进行 on-policy 蒸馏,确保各模态能力同步提升而非相互干扰。

  • 32K → 256K → 1M 的渐进式扩展策略
  • 每一阶段使用高质量长上下文数据进行位置编码适配
  • 扩展完成后,1M 上下文不再计费倍率(Token Plan 更新)
基准MiMo-V2.5MiMo-V2.5-Pro对比模型
Claw-Eval (General Subset)62.3未公开Pareto 前沿
MiMo Coding Bench (Internal)接近 V2.5-Pro基线匹配 V2.5-Pro 但成本减半
  • 在视频理解任务上匹配 Gemini 3 Pro
  • 在多模态 Agent 任务上匹配 Claude Sonnet 4.6
  • 图像和文档理解保持竞争力
  • MiMo-V2.5(1x token 费率)在 agentic 任务上实现 V2.5-Pro(2x 费率)接近的体验
  • 1M 上下文不再额外计费
  • 完全开源(MIT 协议)
  • Hugging Face 可下载权重和 tokenizer
  • 含 Base(256K 上下文)和 Chat(1M 上下文)两个版本
维度V2-FlashV2.5
参数量309B / 15B active310B / 15B active
训练 token27T48T (+78%)
模态文本文本 + 视觉 + 音频
上下文256K1M
训练阶段标准预训练 + SFT + RL五阶段管线(含 projector warmup + 多模态预训练 + MOPD)
Agent 能力更强(全模态 Agent)
  • 对比 GPT-5.6 / Claude Fable 5:小米选择了完全开源的路线,且将模型权重以 MIT 协议发布。代价是需依赖外部生态(Hugging Face、社区)进行部署优化。
  • 对比 GLM-5V-Turbo:MiMo-V2.5 和 GLM-5V-Turbo 都走原生全模态路线,但小米的参数量更大(310B vs 未公开),且选择在发布时就开源权重。
  • 对比 Qwen3.5-Omni:Qwen3.5-Omni 也支持全模态端到端,但 MiMo-V2.5 的 MoE 架构在推理效率上有理论优势(13-15B 激活 vs Qwen3.5 的 27B 密集参数)。
  • V2.5 与 V2.5-Pro 共享同代架构,但 Pro 版本使用 1T 总参 / 42B 激活
  • V2.5 在 agentic benchmark 上与 Pro 版本差距很小(MiMo Coding Bench 上接近匹配)
  • 定价差异:V2.5 的 token 费率仅为 Pro 的一半
  • NVIDIA 开发者论坛上有大量关于 MiMo-V2.5 在 DGX Spark 上本地部署的讨论
  • 社区普遍认可其性价比:1x 费率获得接近 V2.5-Pro 的 agentic 体验
  • 1M 上下文不另收费的决定被认为是对企业用户的关键吸引力
  • 作为完全开源的全模态 MoE 模型,被开发者社区视为「可以用在生产的 DeepSeek 级别竞争方案」
  1. 五阶段训练管线是可靠的模态融合策略——先独立训练各模态骨干,再逐步对齐,最后联合 RL 优化。比端到端从头训练更稳定、更容易调试。
  2. 渐进式上下文扩展(32K → 256K → 1M)比一次性扩展到 1M 更可行——每一阶段使用专门优化的长上下文数据,避免位置编码突然不适配。
  3. MOPD 从纯文本扩展到多模态场景——多个教师模型分别在各自模态上指导学生模型,避免单教师模式下的模态竞争。
  4. FP8 训练 + MIT 开源的组合 = 社区的放大器——低精度权重减少了分发和部署的硬件门槛,让社区更容易在消费级 GPU 上运行。
  5. Token 计费的简化(1M 上下文不额外计费)是产品化的关键决策——降低了企业评估的长尾成本顾虑。