MiMo-7B — 从预训练到后训练解锁推理潜力
MiMo-7B (首次发布)
Section titled “MiMo-7B (首次发布)”发布日期: 2024-12-10(开源发布)
来源: arXiv 2505.07608 (2025-05)
工程范式: 推理潜力预训练 —— 从数据构造到 RL 的完整推理优化管线。
MiMo(小米 LLM-Core 团队)的核心理念:推理能力不是后训练阶段才能注入的,而是需要在预训练阶段就奠定基础。
MiMo-7B 的独特贡献在于展示了从预训练到后训炼的完整推理优化管线:
- 预训练:专门构造推理数据(数学、代码、STEM),包括合成推理数据
- SFT:500K 精细清洗的指令数据
- RL(GRPO 变体):130K 可验证问题 + 测试难度驱动奖励
关键结果:MiMo-7B-RL 在 AIME 2025 上达到 55.4,超过 OpenAI o1-mini 4.7 分。
关键架构决策
Section titled “关键架构决策”预训练(25T tokens)
Section titled “预训练(25T tokens)”三阶段数据混合:
| 阶段 | 组成 | 上下文 | 训练 tokens |
|---|---|---|---|
| 1 | 全源(无合成数据);下调广告/新闻、上调专业领域 | 8,192 | 主要部分 |
| 2 | 阶段1 + ~70% 数学和代码 | 8,192 | ~4T |
| 3 | 阶段2 + ~10% 合成推理数据 | 32,768 | ~500B |
数据创新:
- 自定义 HTML/PDF 提取工具(保留公式、代码块)
- URL + MinHash 去重(每 dump < 1 天)
- 小 LLM 质量标注(非启发式规则)
- 合成推理数据:高级推理模型产出的 STEM 分析、数学/代码
- 标准 Decoder-only Transformer:GQA、pre-RMSNorm、SwiGLU、RoPE
- 36 层,hidden dim 4096,FFN 11008,32 heads,8 KV groups
- Multi-Token Prediction (MTP):预训练使用 1 个 MTP 层,推理使用 3 个 MTP 层
- 第一 MTP 层接受率 ~90%,第三层 >75%
- 用于推理阶段的投机解码加速
SFT:
- 500K 样本(开源 + 专有蒸馏)
- 16-gram 重叠去污染
- 排除混合/不完整响应
RL(修改版 GRPO):
- 130K 可验证问题(100K 数学 + 30K 代码)
- 去除 KL 损失(关键修改——允许策略更大程度探索)
- 测试难度驱动奖励(受 IOI 评分启发)
- 数学:规则验证(Math-Verify)
- 代码:test case 按通过率分 easy/medium/hard,分级奖励
Base 模型评估(7B 级别)
Section titled “Base 模型评估(7B 级别)”| 基准 | MiMo-7B-Base | Qwen2.5-7B | Llama 3.1-8B |
|---|---|---|---|
| BBH | 75.2 | ~70 | ~65 |
| AIME 2024 | 32.9 | ~10 | ~5 |
| AIME 2025 | 24.3 | ~5 | ~3 |
| LiveCodeBench v5 | 32.9 | 5.0 | - |
| CRUXEval-O | 56.3 | - | - |
MiMo-7B-Base 的推理潜力远超同尺寸模型——Pass@k 曲线随 k 增大超越 32B 基线。
RL 模型评估
Section titled “RL 模型评估”| 基准 | MiMo-7B-RL | o1-mini | DeepSeek-R1-7B |
|---|---|---|---|
| AIME 2025 | 55.4 | 50.7 | - |
| LiveCodeBench v5 | 显著领先 | 被超越 | - |
| LiveCodeBench v6 | 显著领先 | 被超越 | - |
- 知乎上 MiMo-7B-RL 被认为是 “7B 推理模型的里程碑”
| 维度 | MiMo-7B | Qwen2.5-7B | DeepSeek-R1-7B |
|---|---|---|---|
| 训练数据 | 25T tokens | 18T tokens | - |
| 预训练推理数据 | ✅ 合成数据 | 部分 | - |
| MTP | ✅ | ❌ | ❌ |
| 测试难度奖励 | ✅ | ❌ | ❌ |
| 去除 KL 的 GRPO | ✅ | ❌ | 使用 GRPO |
| 超 o1-mini | ✅ | ❌ | 部分 |
可复用的工程经验
Section titled “可复用的工程经验”- 推理能力从预训练开始——MiMo 证明 25T 中的推理数据构造是基础模型推理潜力的关键。
- 合成推理数据可以多 epoch 训练而不过拟合——这是一个重要的发现。
- 去除 KL 损失的 GRPO 变体在推理任务上更有效——允许更大探索空间。
- 测试难度驱动奖励代码(受 IOI 评分启发)是比 all-or-nothing 更有效的奖励设计。
- MTP 推理加速——3 层 MTP 在推理时提供 ~2.6× 加速。
- 7B 模型超 o1-mini——证明了小模型通过针对性优化可以超越大型通用模型的推理能力。