MiMo-V2.5 — 小米全模态 Agent 模型的开源突围
MiMo-V2.5:原生全模态 Agent 模型
Section titled “MiMo-V2.5:原生全模态 Agent 模型”发布日期: 2026-04-22 来源: Xiaomi MiMo 官方产品页 / 模型发布日志 工程范式: 原生全模态 Agent 统一模型路线——在单一 MoE 架构中集成视觉+音频理解,通过五阶段训练渐进扩展上下文至 1M。
注意: 截至目前(2026-07-14),小米未发布 MiMo-V2.5 的正式 arxiv 技术报告。以下分析基于官方产品页面和模型发布日志,部分架构细节来自公共信息。
小米 MiMo 团队的核心约束是在开源许可下交付有竞争力的全模态 Agent 模型。V2.5 的设计选择体现了三条原则:
- 全模态原生整合而非拼接——视觉和音频编码器与语言骨干在训练中深度对齐,而非简单地在推理时拼接。通过 projector warmup → 多模态预训练 → RL/MOPD 的五阶段管线,确保各模态在模型中作为一等公民。
- Agent 能力作为训练目标而非事后补丁——从文本预训练到 RL 阶段,Agent 任务(工具调用、多步推理、环境交互)是贯穿始终的设计约束,不是最后加上的 API 层。
- 规模效率优先于参数堆叠——310B 总参 / 15B 激活的稠密-稀疏比(20.7:1),搭配 48T token 训练,在不牺牲推理效率的前提下达到竞争性能力。
关键架构决策
Section titled “关键架构决策”| 配置 | 总参 | 激活参 | 上下文 | 精度 |
|---|---|---|---|---|
| MiMo-V2.5-Base | 310B | 15B | 256K | FP8 (E4M3) Mixed |
| MiMo-V2.5 | 310B | 15B | 1M | FP8 (E4M3) Mixed |
| MiMo-V2.5-Pro | ~1T | 42B | 1M | 未公开 |
- 继承 MiMo-V2-Flash 的混合注意力架构(滑动窗口 + 全局注意力,5:1 比例,128-token 窗口)
- Sparse MoE(激活 15B / 总 310B)
- MTP(Multi-Token Prediction)在训练和推理中复用——训练时做预测头,推理时用作投机解码的 draft 模型
- 原生 32K 上下文,通过渐进式训练扩展到 256K(Base)和 1M(Chat)
- 视觉编码器: 自研视觉编码器,通过轻量级 projector 连接至语言骨干
- 音频编码器: 自研音频编码器,通过独立 projector 连接
- 两编码器均在内部数据上预训练,而非使用现成开源组件
- 五个训练阶段中,前三个阶段专门用于模态对齐:
- 文本预训练(构建 LLM 骨干)
- Projector warming(对齐视觉/音频 projector)
- 多模态预训练(大规模跨模态数据)
- SFT + Agentic Post-training(渐进式上下文扩展从 32K → 256K → 1M)
- RL + MOPD(强化感知、推理和 Agent 能力)
MOPD(Multi-Teacher On-Policy Distillation)
Section titled “MOPD(Multi-Teacher On-Policy Distillation)”详见 V2-Flash 报告中已有介绍。V2.5 将 MOPD 扩展到多模态场景——在 RL 阶段使用多个教师模型(视觉、音频、文本)进行 on-policy 蒸馏,确保各模态能力同步提升而非相互干扰。
- 32K → 256K → 1M 的渐进式扩展策略
- 每一阶段使用高质量长上下文数据进行位置编码适配
- 扩展完成后,1M 上下文不再计费倍率(Token Plan 更新)
Agent 基准
Section titled “Agent 基准”| 基准 | MiMo-V2.5 | MiMo-V2.5-Pro | 对比模型 |
|---|---|---|---|
| Claw-Eval (General Subset) | 62.3 | 未公开 | Pareto 前沿 |
| MiMo Coding Bench (Internal) | 接近 V2.5-Pro | 基线 | 匹配 V2.5-Pro 但成本减半 |
- 在视频理解任务上匹配 Gemini 3 Pro
- 在多模态 Agent 任务上匹配 Claude Sonnet 4.6
- 图像和文档理解保持竞争力
- MiMo-V2.5(1x token 费率)在 agentic 任务上实现 V2.5-Pro(2x 费率)接近的体验
- 1M 上下文不再额外计费
- 完全开源(MIT 协议)
- Hugging Face 可下载权重和 tokenizer
- 含 Base(256K 上下文)和 Chat(1M 上下文)两个版本
vs MiMo-V2-Flash(2026 年 1 月)
Section titled “vs MiMo-V2-Flash(2026 年 1 月)”| 维度 | V2-Flash | V2.5 |
|---|---|---|
| 参数量 | 309B / 15B active | 310B / 15B active |
| 训练 token | 27T | 48T (+78%) |
| 模态 | 文本 | 文本 + 视觉 + 音频 |
| 上下文 | 256K | 1M |
| 训练阶段 | 标准预训练 + SFT + RL | 五阶段管线(含 projector warmup + 多模态预训练 + MOPD) |
| Agent 能力 | 强 | 更强(全模态 Agent) |
vs 同类全模态模型
Section titled “vs 同类全模态模型”- 对比 GPT-5.6 / Claude Fable 5:小米选择了完全开源的路线,且将模型权重以 MIT 协议发布。代价是需依赖外部生态(Hugging Face、社区)进行部署优化。
- 对比 GLM-5V-Turbo:MiMo-V2.5 和 GLM-5V-Turbo 都走原生全模态路线,但小米的参数量更大(310B vs 未公开),且选择在发布时就开源权重。
- 对比 Qwen3.5-Omni:Qwen3.5-Omni 也支持全模态端到端,但 MiMo-V2.5 的 MoE 架构在推理效率上有理论优势(13-15B 激活 vs Qwen3.5 的 27B 密集参数)。
vs V2.5-Pro
Section titled “vs V2.5-Pro”- V2.5 与 V2.5-Pro 共享同代架构,但 Pro 版本使用 1T 总参 / 42B 激活
- V2.5 在 agentic benchmark 上与 Pro 版本差距很小(MiMo Coding Bench 上接近匹配)
- 定价差异:V2.5 的 token 费率仅为 Pro 的一半
- NVIDIA 开发者论坛上有大量关于 MiMo-V2.5 在 DGX Spark 上本地部署的讨论
- 社区普遍认可其性价比:1x 费率获得接近 V2.5-Pro 的 agentic 体验
- 1M 上下文不另收费的决定被认为是对企业用户的关键吸引力
- 作为完全开源的全模态 MoE 模型,被开发者社区视为「可以用在生产的 DeepSeek 级别竞争方案」
可复用的工程经验
Section titled “可复用的工程经验”- 五阶段训练管线是可靠的模态融合策略——先独立训练各模态骨干,再逐步对齐,最后联合 RL 优化。比端到端从头训练更稳定、更容易调试。
- 渐进式上下文扩展(32K → 256K → 1M)比一次性扩展到 1M 更可行——每一阶段使用专门优化的长上下文数据,避免位置编码突然不适配。
- MOPD 从纯文本扩展到多模态场景——多个教师模型分别在各自模态上指导学生模型,避免单教师模式下的模态竞争。
- FP8 训练 + MIT 开源的组合 = 社区的放大器——低精度权重减少了分发和部署的硬件门槛,让社区更容易在消费级 GPU 上运行。
- Token 计费的简化(1M 上下文不额外计费)是产品化的关键决策——降低了企业评估的长尾成本顾虑。