跳转到内容

GPT-5.5 — 全新基座模型的 Agentic 时代

发布日期: 2026-04-23
来源: OpenAI 官方博客
工程范式: 统一推理模型路线——自 GPT-4.5 以来首次完全重新训练的基座模型,Agentic 能力实现代际跨越。

GPT-5.5(代号 “Spud”)是 OpenAI 自 GPT-4.5(2025 年 2 月)以来 第一个完全重新训练的基座模型。此前的 GPT-5.x 系列(5.0 到 5.4)全是基于同一基座的后训练迭代。GPT-5.5 标志着:OpenAI 重新相信基座模型的 pre-training scaling 还没有走到尽头,同时将 agentic 能力作为核心设计目标。

关键信号:GPT-5.5 在 Terminal-Bench 2.0 上达到 82.7%,这是一个测试 agentic 命令行工作流(多步规划 + 工具协调)的基准——模型不仅需要知道答案,还需要能执行复杂操作序列。

  • 全新基座模型: 自 GPT-4.5 以来首次完全重新训练的架构
  • Agentic 优先设计: 原生支持终端操作、代码执行、复杂工具链
  • 推理能力: 延续 GPT-5 的路由系统,但 thinking 模型的深度大幅提升
  • 成本定价: $5/$30 per million tokens(输入/输出),约 GPT-5.4 的 2 倍
  • 上下文窗口: 1M tokens,MRCR 74% at 512K-1M(检索准确率)
  • 核心突破发现: 帮助发现了关于 Ramsey 数的新数学证明
基准GPT-5.5GPT-5.4Claude Opus 4.7
AA Index60--
Terminal-Bench 2.082.7%75.1%69.4%
SWE-bench Verified88.7%--
Expert-SWE73.1%--
MMLU92.4%--
OSWorld78.7%--
MRCR (512K-1M)74%--
模型输入(/$1M tokens)输出(/$1M tokens)倍数
GPT-5.5$5$302x GPT-5.4
GPT-5.4~$2.50~$15基线
o3$10$40更贵但擅长推理
维度GPT-5.5(新基座)GPT-5.4(后训练迭代)Claude Opus 4.7
基座全新训练沿用前期基座自家基座
Agentic 设计原生后加后加
Terminal-Bench82.7%75.1%69.4%
定价$5/$30~$2.50/$15~$15/$60
定位全能+Agentic通用深度推理
  1. 基座模型重训仍能带来代际提升 —— 后训练迭代不是万能的,pre-training scaling 还有空间
  2. Agentic 能力正在成为模型评估的核心维度 —— Terminal-Bench 比 MMLU 更能反映实际有用性
  3. Agentic 能力的前沿正在快速推进 —— 从 75.1% 到 82.7% 是三个月内的跃升,远非饱和状态
  4. 更大更贵的模型需要明确的差异化价值 —— GPT-5.5 定价翻倍,但 Terminal-Bench 提升 7.6 个百分点
  5. 科学发现(Ramsey 数证明)是模型能力溢出效应的最好证明 —— 模型不仅能完成工程任务,还能做原创数学研究