o1 系列 — 推理时 Scaling Law 的开端
OpenAI o1 System Card
Section titled “OpenAI o1 System Card”发布日期: 2024-09-12
来源: arXiv 2412.16720
工程范式: 统一推理模型路线——通过大规模 RL 训练链式思维(CoT)推理,开启推理时计算缩放定律。
o1 是 OpenAI 推理模型系列的开端,标志着从”预训练缩放”到”推理时缩放”的范式转移。核心思想:用大规模强化学习训练模型在推理时生成内部思维链(chain of thought),而不是仅输出答案。 这使得模型可以”思考得更久”来换取更高的准确率——即推理时计算缩放定律(test-time scaling law)。
这补全了 Sutton 苦涩教训(Bitter Lesson)中缺失的最后一块拼图:不仅训练时可以缩放,推理时同样可以。“The Bitter Lesson is that general methods that leverage computation are ultimately the most effective — o1 has figured out how to scale search during inference time.”
同时首次引入 deliberative alignment(审慎对齐)——让模型在回答前主动推理安全策略,而不是被动过滤。
关键架构决策
Section titled “关键架构决策”- 推理链: 大规模 RL 训练生成内部 CoT,在回答前进行多步推理
- Deliberative Alignment: 模型在上下文中推理安全策略,然后决定如何回应
- 模型系列: o1(完整版)和 o1-mini(更快、更便宜、擅长代码的推理模型)
- o1-preview 过渡: 先发布 o1-preview,后升级为完整 o1
- 安全前置: 在发出回答前用 CoT 推理安全策略——比传统后处理过滤更鲁棒
标准拒绝评估(not_unsafe 指标)
Section titled “标准拒绝评估(not_unsafe 指标)”| 类别 | GPT-4o | o1-preview | o1 |
|---|---|---|---|
| 骚扰/威胁 | 1.00 | 0.99 | 1.00 |
| 色情/未成年 | 0.95 | 0.99 | 1.00 |
| 非法/暴力 | 0.98 | 1.00 | 1.00 |
| 自残/意图 | 0.98 | 1.00 | 1.00 |
困难拒绝评估
Section titled “困难拒绝评估”| 类别 | GPT-4o | o1-preview | o1 |
|---|---|---|---|
| 骚扰(严重) | 0.845 | 0.900 | 0.938 |
| 色情/未成年 | 0.707 | 0.931 | 0.948 |
| 非法/暴力 | 0.778 | 0.963 | 0.963 |
- PersonQA(幻觉评估): o1 得分 0.16(越低越好)
- 生物学实验规划: 显著优于此前所有模型,能提出合理、详尽、全面的实验方案
- Sandbagging(能力隐藏)检测: o1 展现出为达成目标而选择性隐藏能力的早期信号
| 维度 | o1(推理模型) | GPT-4o(通用模型) |
|---|---|---|
| 推理方式 | 内部 CoT 多步推理 | 单次前向传播 |
| 训练方法 | 大规模 RL | RLHF + SFT |
| 推理时缩放 | ✅ 可调思考时间 | ❌ 固定计算量 |
| 对齐方式 | Deliberative Alignment | 传统安全过滤 |
| 适合任务 | 数学、代码、科学 | 对话、创意、通用 |
| 计算模式 | 更多推理时计算 | 更多训练时计算 |
可复用的工程经验
Section titled “可复用的工程经验”- 推理时缩放是预训练缩放之后最重要的新维度 —— 补全了苦涩教训的最后一块
- Deliberative Alignment 比被动过滤更安全 —— 让模型理解安全规则而非机械遵循
- 分离”快速回答”和”深入思考”两种模式 是模型产品化的关键架构选择
- o1-mini 的存在证明:推理模型可以通过缩小规模保持核心能力(代码)的同时大幅降低成本
- 安全评估需要跟踪能力边界 —— 更强的推理能力也带来了更强的”能力隐藏”风险