跳转到内容

Gemini 2.5 — 前沿推理的 Agentic 能力密度

发布日期: 2025-03-25
来源: Google DeepMind 技术报告
工程范式: Agentic 能力密度路线——在推理能力上实现跨越式提升,同时强化 Agentic 能力。

Gemini 2.5 是 DeepMind 在推理能力上实现代际跨越的版本。2.5 Pro 在 AIME 2025、GPQA Diamond 等推理基准上大幅超越此前所有 Gemini 模型,同时保持 Gemini 家族的原生多模态和长上下文传统。

关键信号:3200+ 名研究人员 被列为 Gemini 2.5 的贡献者——反映了模型训练和前沿研究的组织规模。

  • 架构: 延续并改进 MoE Transformer 架构
  • Deep Think 模式: 增强推理版本,使用并行思考和 RL 同时测试多个假设
  • 上下文: 延续 1M+ tokens 能力
  • 模态: 原生多模态(文本、图像、音频、视频)
  • 可用性: Pro 发布了 Flash 版本,覆盖更多成本-速度场景
基准Gemini 2.5 Proo3o4-miniClaude Opus 4
AIME 2025 (单次)88.0%88.9%92.7%70.5%
GPQA Diamond (单次)86.4%83.3%81.4%75.4%
Aider Polyglot82.2%79.6%72.0%61.3%
LiveCodeBench74.2%72.0%75.8%48.9%
SimpleQA (事实性)54.0%48.6%19.3%-
FACTS Grounding87.8%69.9%62.1%79.1%
MMMU (图像)82.0%82.9%81.6%74.4%
基准Gemini 2.5 Proo3GPT 4.1
LOFT (hard ≤128K)87.0%77.0%60.5%
MRCR-V2 (≤128K)58.0%57.1%36.3%
MRCR-V2 (1M)16.4%--
设置Gemini 2.5 Proo3Sonnet 4
单次尝试59.6%69.1%72.7%
多次尝试67.2%-80.2%
维度Gemini 2.5 Pro2.5 Deep ThinkOpenAI o3
推理能力很强更强(并行思考)很强
Deep Think 模式✅ 并行 + RL❌(但 o3-pro 有更多思考)
事实性54.0% SimpleQA-48.6%
多模态原生原生
长上下文10M-128K
  1. 并行思考(parallel thinking)是超越顺序 CoT 的推理架构方向 —— 同时测试多个假设的效率高于线性链式推理
  2. 事实性基准(SimpleQA、FACTS)正在成为核心评估维度 —— 强推理模型也需要强事实性
  3. 3200+ 人的团队规模揭示了前沿模型开发的组织复杂度 —— 模型训练已成为大规模系统工程
  4. 长上下文能力是 Gemini 家族的持续护城河 —— LOFT 和 MRCR 上的表现大幅领先竞品
  5. Split of Pro vs Flash vs Deep Think 是多粒度产品化的良好实践 —— 不同计算预算匹配不同推理深度