跳转到内容

MiniMax M2.5 — 现实世界生产力的后训练进化里程碑

发布日期: 2025-06-01
来源: MiniMax 官方博客 / arXiv 2605.26494
工程范式: 硬核系统协同设计——后训练管线进化的中间里程碑。

M2.5 是 M2 系列后训练管线进化的关键节点,定位为 面向现实世界生产力的推理模型。核心改进来自在大规模 RL 训练中引入数十万个复杂真实世界环境,而非合成基准。

关键价值主张:极低推理成本 + 极快执行速度。运行成本低至 $1/小时(100 tokens/s)$0.30/小时(50 tokens/s)

  • 基座: M2 系列 229.9B/9.8B 激活模型
  • 训练数据: 数十万复杂真实世界环境中的 RL 训练
  • 推理优化: 学会高效推理和最优任务分解
  • 执行速度: SWE-bench Verified 评估比 M2.1 快 37%,匹配 Claude Opus 4.6 速度
基准M2.5M2.1Claude Opus 4.6
SWE-bench Verified80.2%-SOTA
Multi-SWE-Bench51.3%--
BrowseComp76.3%--
执行速度+37% vs M2.1基线匹配
成本(100 tok/s)$1/小时-$15/小时+
多语言编码显著提升--
维度M2.5M2Opus 4.6
SWE-bench80.2%-SOTA
速度+37% vs M2.1基线
成本极低
定位生产力推理通用推理深度推理
  1. 真实世界环境数据的 RL 训练是提升实际能力的最有效途径 —— 非合成的数十万个环境覆盖了更广的分布
  2. 推理速度优化是推理模型的关键维度 —— M2.5 比 M2.1 快 37%,这个速度提升对用户体验和成本都是质变
  3. 极低成本推理($1/小时)打开了新的应用场景 —— 可以持续运行、持续监控、批量处理
  4. 多语言编码在推理模型场景中有显著提升空间 —— M2.5 在此方面展现出突出改进