GPT-5 — 统一推理与快速模型的智能路由系统
GPT-5 System Card
Section titled “GPT-5 System Card”发布日期: 2025-08-07
来源: arXiv 2601.03267
工程范式: 统一推理模型路线——第一次将快速模型与推理模型通过智能路由器统一在一个系统内。
GPT-5 的核心创新不是单个模型的提升,而是一个 多模型智能系统 的设计:包含一个快速高吞吐的 main 模型(处理大多数问题)和一个更深度的 thinking 模型(处理难题),并配有 实时路由器 在两者间智能切换。
路由依据:对话类型、任务复杂度、工具需求、以及用户的显式意图(如提示词中包含”think hard about this”)。
这一设计体现了 OpenAI 的核心洞察:用户不需要在所有问题上都让模型思考很长时间,但需要在复杂问题上能得到深度推理。 在这两者之间自动切换,而非让用户手动选择。
关键架构决策
Section titled “关键架构决策”| 模型 | 定位 | 特性 |
|---|---|---|
| gpt-5-main | 快速高吞吐模型 | 处理大多数常规问题 |
| gpt-5-main-mini | 更小的快速模型 | 低成本版本 |
| gpt-5-thinking | 深度推理模型 | 使用并行测试时计算 |
| gpt-5-thinking-mini | 小型推理模型 | 轻量推理 |
| gpt-5-thinking-nano | 极小推理模型 | 为开发者构建的超轻量版 |
| gpt-5-thinking-pro | 深度推理专业版 | ChatGPT Pro 中可用,使用并行测试时计算 |
- 输入: 对话类型、复杂度评估、工具需求、显式意图信号
- 决策: 实时选择 main 或 thinking 系列
- 容错: 用户可通过提示词控制路由(如 “think hard” 强制走 thinking 路径)
标准拒绝评估(not_unsafe 指标)
Section titled “标准拒绝评估(not_unsafe 指标)”| 类别 | gpt-5-thinking-mini | gpt-5-thinking-nano | o4-mini | gpt-5-main-mini |
|---|---|---|---|---|
| 仇恨内容 | 0.996 | 0.987 | 0.983 | 0.996 |
| 色情/未成年 | 0.990 | 0.990 | 1.000 | 1.000 |
| 非法/非暴力 | 1.000 | 0.991 | 0.991 | 0.974 |
| 自残 | 0.989 | 0.989 | 1.000 | 0.989 |
| 极端主义 | 0.944 | 0.955 | 0.864 | 0.909 |
StrongReject 评估
Section titled “StrongReject 评估”| 类别 | gpt-5-thinking-mini | gpt-5-main-mini |
|---|---|---|
| 非法/非暴力犯罪提示 | 0.994 | 0.940 |
| 暴力提示 | 0.996 | 0.949 |
| 虐待/虚假信息/仇恨提示 | 0.973 | 0.971 |
| 色情内容提示 | 0.994 | 0.953 |
| 维度 | GPT-5(统一系统) | GPT-4o(单一模型) | o1/o3(纯推理) |
|---|---|---|---|
| 架构 | 多模型+路由器 | 单一模型 | 单一推理模型 |
| 响应速度 | 动态适应 | 固定 | 慢(思考时间长) |
| 成本效率 | 高(路由优化) | 固定 | 低(长于 1 分钟思考) |
| 推理能力 | 按需可达 | 有限 | 深入 |
| 用户选择 | 隐式+显式控制 | 单一模式 | 单一模式 |
可复用的工程经验
Section titled “可复用的工程经验”- 多模型路由系统比单一模型更高效 —— 大多数用户不需要推理模型的所有能力,路由可以节省大量计算
- 推理模型的能力密度持续提升 —— gpt-5-thinking-nano 这样的小模型也能用推理时计算追赶大模型
- 路由器的”显式意图”信号设计很关键 —— 用户说”think harder”时应该生效
- 安全评估需要覆盖所有子模型 —— 不同子模型的安全特性差异显著,不能只看旗舰版本
- 并行测试时计算(parallel test time compute)是推理模型 pro 版的核心差异化能力