GPT-5.5 — 全新基座模型的 Agentic 时代
GPT-5.5 Technical Report
Section titled “GPT-5.5 Technical Report”发布日期: 2026-04-23
来源: OpenAI 官方博客
工程范式: 统一推理模型路线——自 GPT-4.5 以来首次完全重新训练的基座模型,Agentic 能力实现代际跨越。
GPT-5.5(代号 “Spud”)是 OpenAI 自 GPT-4.5(2025 年 2 月)以来 第一个完全重新训练的基座模型。此前的 GPT-5.x 系列(5.0 到 5.4)全是基于同一基座的后训练迭代。GPT-5.5 标志着:OpenAI 重新相信基座模型的 pre-training scaling 还没有走到尽头,同时将 agentic 能力作为核心设计目标。
关键信号:GPT-5.5 在 Terminal-Bench 2.0 上达到 82.7%,这是一个测试 agentic 命令行工作流(多步规划 + 工具协调)的基准——模型不仅需要知道答案,还需要能执行复杂操作序列。
关键架构决策
Section titled “关键架构决策”- 全新基座模型: 自 GPT-4.5 以来首次完全重新训练的架构
- Agentic 优先设计: 原生支持终端操作、代码执行、复杂工具链
- 推理能力: 延续 GPT-5 的路由系统,但 thinking 模型的深度大幅提升
- 成本定价: $5/$30 per million tokens(输入/输出),约 GPT-5.4 的 2 倍
- 上下文窗口: 1M tokens,MRCR 74% at 512K-1M(检索准确率)
- 核心突破发现: 帮助发现了关于 Ramsey 数的新数学证明
| 基准 | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 |
|---|---|---|---|
| AA Index | 60 | - | - |
| Terminal-Bench 2.0 | 82.7% | 75.1% | 69.4% |
| SWE-bench Verified | 88.7% | - | - |
| Expert-SWE | 73.1% | - | - |
| MMLU | 92.4% | - | - |
| OSWorld | 78.7% | - | - |
| MRCR (512K-1M) | 74% | - | - |
| 模型 | 输入(/$1M tokens) | 输出(/$1M tokens) | 倍数 |
|---|---|---|---|
| GPT-5.5 | $5 | $30 | 2x GPT-5.4 |
| GPT-5.4 | ~$2.50 | ~$15 | 基线 |
| o3 | $10 | $40 | 更贵但擅长推理 |
| 维度 | GPT-5.5(新基座) | GPT-5.4(后训练迭代) | Claude Opus 4.7 |
|---|---|---|---|
| 基座 | 全新训练 | 沿用前期基座 | 自家基座 |
| Agentic 设计 | 原生 | 后加 | 后加 |
| Terminal-Bench | 82.7% | 75.1% | 69.4% |
| 定价 | $5/$30 | ~$2.50/$15 | ~$15/$60 |
| 定位 | 全能+Agentic | 通用 | 深度推理 |
可复用的工程经验
Section titled “可复用的工程经验”- 基座模型重训仍能带来代际提升 —— 后训练迭代不是万能的,pre-training scaling 还有空间
- Agentic 能力正在成为模型评估的核心维度 —— Terminal-Bench 比 MMLU 更能反映实际有用性
- Agentic 能力的前沿正在快速推进 —— 从 75.1% 到 82.7% 是三个月内的跃升,远非饱和状态
- 更大更贵的模型需要明确的差异化价值 —— GPT-5.5 定价翻倍,但 Terminal-Bench 提升 7.6 个百分点
- 科学发现(Ramsey 数证明)是模型能力溢出效应的最好证明 —— 模型不仅能完成工程任务,还能做原创数学研究