发布日期: 2025-03-25
来源: Google DeepMind 技术报告
工程范式: Agentic 能力密度路线——在推理能力上实现跨越式提升,同时强化 Agentic 能力。
Gemini 2.5 是 DeepMind 在推理能力上实现代际跨越的版本。2.5 Pro 在 AIME 2025、GPQA Diamond 等推理基准上大幅超越此前所有 Gemini 模型,同时保持 Gemini 家族的原生多模态和长上下文传统。
关键信号:3200+ 名研究人员 被列为 Gemini 2.5 的贡献者——反映了模型训练和前沿研究的组织规模。
- 架构: 延续并改进 MoE Transformer 架构
- Deep Think 模式: 增强推理版本,使用并行思考和 RL 同时测试多个假设
- 上下文: 延续 1M+ tokens 能力
- 模态: 原生多模态(文本、图像、音频、视频)
- 可用性: Pro 发布了 Flash 版本,覆盖更多成本-速度场景
| 基准 | Gemini 2.5 Pro | o3 | o4-mini | Claude Opus 4 |
|---|
| AIME 2025 (单次) | 88.0% | 88.9% | 92.7% | 70.5% |
| GPQA Diamond (单次) | 86.4% | 83.3% | 81.4% | 75.4% |
| Aider Polyglot | 82.2% | 79.6% | 72.0% | 61.3% |
| LiveCodeBench | 74.2% | 72.0% | 75.8% | 48.9% |
| SimpleQA (事实性) | 54.0% | 48.6% | 19.3% | - |
| FACTS Grounding | 87.8% | 69.9% | 62.1% | 79.1% |
| MMMU (图像) | 82.0% | 82.9% | 81.6% | 74.4% |
| 基准 | Gemini 2.5 Pro | o3 | GPT 4.1 |
|---|
| LOFT (hard ≤128K) | 87.0% | 77.0% | 60.5% |
| MRCR-V2 (≤128K) | 58.0% | 57.1% | 36.3% |
| MRCR-V2 (1M) | 16.4% | - | - |
| 设置 | Gemini 2.5 Pro | o3 | Sonnet 4 |
|---|
| 单次尝试 | 59.6% | 69.1% | 72.7% |
| 多次尝试 | 67.2% | - | 80.2% |
| 维度 | Gemini 2.5 Pro | 2.5 Deep Think | OpenAI o3 |
|---|
| 推理能力 | 很强 | 更强(并行思考) | 很强 |
| Deep Think 模式 | ❌ | ✅ 并行 + RL | ❌(但 o3-pro 有更多思考) |
| 事实性 | 54.0% SimpleQA | - | 48.6% |
| 多模态 | 原生 | 原生 | 有 |
| 长上下文 | 10M | - | 128K |
- 并行思考(parallel thinking)是超越顺序 CoT 的推理架构方向 —— 同时测试多个假设的效率高于线性链式推理
- 事实性基准(SimpleQA、FACTS)正在成为核心评估维度 —— 强推理模型也需要强事实性
- 3200+ 人的团队规模揭示了前沿模型开发的组织复杂度 —— 模型训练已成为大规模系统工程
- 长上下文能力是 Gemini 家族的持续护城河 —— LOFT 和 MRCR 上的表现大幅领先竞品
- Split of Pro vs Flash vs Deep Think 是多粒度产品化的良好实践 —— 不同计算预算匹配不同推理深度