跳转到内容

MiMo-7B — 从预训练到后训练解锁推理潜力

发布日期: 2024-12-10(开源发布)
来源: arXiv 2505.07608 (2025-05)
工程范式: 推理潜力预训练 —— 从数据构造到 RL 的完整推理优化管线。

MiMo(小米 LLM-Core 团队)的核心理念:推理能力不是后训练阶段才能注入的,而是需要在预训练阶段就奠定基础

MiMo-7B 的独特贡献在于展示了从预训练到后训炼的完整推理优化管线

  1. 预训练:专门构造推理数据(数学、代码、STEM),包括合成推理数据
  2. SFT:500K 精细清洗的指令数据
  3. RL(GRPO 变体):130K 可验证问题 + 测试难度驱动奖励

关键结果:MiMo-7B-RL 在 AIME 2025 上达到 55.4,超过 OpenAI o1-mini 4.7 分

三阶段数据混合:

阶段组成上下文训练 tokens
1全源(无合成数据);下调广告/新闻、上调专业领域8,192主要部分
2阶段1 + ~70% 数学和代码8,192~4T
3阶段2 + ~10% 合成推理数据32,768~500B

数据创新:

  • 自定义 HTML/PDF 提取工具(保留公式、代码块)
  • URL + MinHash 去重(每 dump < 1 天)
  • 小 LLM 质量标注(非启发式规则)
  • 合成推理数据:高级推理模型产出的 STEM 分析、数学/代码
  • 标准 Decoder-only Transformer:GQA、pre-RMSNorm、SwiGLU、RoPE
  • 36 层,hidden dim 4096,FFN 11008,32 heads,8 KV groups
  • Multi-Token Prediction (MTP):预训练使用 1 个 MTP 层,推理使用 3 个 MTP 层
    • 第一 MTP 层接受率 ~90%,第三层 >75%
    • 用于推理阶段的投机解码加速

SFT

  • 500K 样本(开源 + 专有蒸馏)
  • 16-gram 重叠去污染
  • 排除混合/不完整响应

RL(修改版 GRPO)

  • 130K 可验证问题(100K 数学 + 30K 代码)
  • 去除 KL 损失(关键修改——允许策略更大程度探索)
  • 测试难度驱动奖励(受 IOI 评分启发)
  • 数学:规则验证(Math-Verify)
  • 代码:test case 按通过率分 easy/medium/hard,分级奖励
基准MiMo-7B-BaseQwen2.5-7BLlama 3.1-8B
BBH75.2~70~65
AIME 202432.9~10~5
AIME 202524.3~5~3
LiveCodeBench v532.95.0-
CRUXEval-O56.3--

MiMo-7B-Base 的推理潜力远超同尺寸模型——Pass@k 曲线随 k 增大超越 32B 基线。

基准MiMo-7B-RLo1-miniDeepSeek-R1-7B
AIME 202555.450.7-
LiveCodeBench v5显著领先被超越-
LiveCodeBench v6显著领先被超越-
  • 知乎上 MiMo-7B-RL 被认为是 “7B 推理模型的里程碑”
维度MiMo-7BQwen2.5-7BDeepSeek-R1-7B
训练数据25T tokens18T tokens-
预训练推理数据✅ 合成数据部分-
MTP
测试难度奖励
去除 KL 的 GRPO使用 GRPO
超 o1-mini部分
  1. 推理能力从预训练开始——MiMo 证明 25T 中的推理数据构造是基础模型推理潜力的关键。
  2. 合成推理数据可以多 epoch 训练而不过拟合——这是一个重要的发现。
  3. 去除 KL 损失的 GRPO 变体在推理任务上更有效——允许更大探索空间。
  4. 测试难度驱动奖励代码(受 IOI 评分启发)是比 all-or-nothing 更有效的奖励设计。
  5. MTP 推理加速——3 层 MTP 在推理时提供 ~2.6× 加速。
  6. 7B 模型超 o1-mini——证明了小模型通过针对性优化可以超越大型通用模型的推理能力。