MiniMax M2.5 — 现实世界生产力的后训练进化里程碑
MiniMax M2.5
Section titled “MiniMax M2.5”发布日期: 2025-06-01
来源: MiniMax 官方博客 / arXiv 2605.26494
工程范式: 硬核系统协同设计——后训练管线进化的中间里程碑。
M2.5 是 M2 系列后训练管线进化的关键节点,定位为 面向现实世界生产力的推理模型。核心改进来自在大规模 RL 训练中引入数十万个复杂真实世界环境,而非合成基准。
关键价值主张:极低推理成本 + 极快执行速度。运行成本低至 $1/小时(100 tokens/s) 或 $0.30/小时(50 tokens/s)。
关键架构决策
Section titled “关键架构决策”- 基座: M2 系列 229.9B/9.8B 激活模型
- 训练数据: 数十万复杂真实世界环境中的 RL 训练
- 推理优化: 学会高效推理和最优任务分解
- 执行速度: SWE-bench Verified 评估比 M2.1 快 37%,匹配 Claude Opus 4.6 速度
| 基准 | M2.5 | M2.1 | Claude Opus 4.6 |
|---|---|---|---|
| SWE-bench Verified | 80.2% | - | SOTA |
| Multi-SWE-Bench | 51.3% | - | - |
| BrowseComp | 76.3% | - | - |
| 执行速度 | +37% vs M2.1 | 基线 | 匹配 |
| 成本(100 tok/s) | $1/小时 | - | $15/小时+ |
| 多语言编码 | 显著提升 | - | - |
| 维度 | M2.5 | M2 | Opus 4.6 |
|---|---|---|---|
| SWE-bench | 80.2% | - | SOTA |
| 速度 | +37% vs M2.1 | 基线 | 快 |
| 成本 | 极低 | 低 | 高 |
| 定位 | 生产力推理 | 通用推理 | 深度推理 |
可复用的工程经验
Section titled “可复用的工程经验”- 真实世界环境数据的 RL 训练是提升实际能力的最有效途径 —— 非合成的数十万个环境覆盖了更广的分布
- 推理速度优化是推理模型的关键维度 —— M2.5 比 M2.1 快 37%,这个速度提升对用户体验和成本都是质变
- 极低成本推理($1/小时)打开了新的应用场景 —— 可以持续运行、持续监控、批量处理
- 多语言编码在推理模型场景中有显著提升空间 —— M2.5 在此方面展现出突出改进