跳转到内容

o1 系列 — 推理时 Scaling Law 的开端

发布日期: 2024-09-12
来源: arXiv 2412.16720
工程范式: 统一推理模型路线——通过大规模 RL 训练链式思维(CoT)推理,开启推理时计算缩放定律。

o1 是 OpenAI 推理模型系列的开端,标志着从”预训练缩放”到”推理时缩放”的范式转移。核心思想:用大规模强化学习训练模型在推理时生成内部思维链(chain of thought),而不是仅输出答案。 这使得模型可以”思考得更久”来换取更高的准确率——即推理时计算缩放定律(test-time scaling law)。

这补全了 Sutton 苦涩教训(Bitter Lesson)中缺失的最后一块拼图:不仅训练时可以缩放,推理时同样可以。“The Bitter Lesson is that general methods that leverage computation are ultimately the most effective — o1 has figured out how to scale search during inference time.”

同时首次引入 deliberative alignment(审慎对齐)——让模型在回答前主动推理安全策略,而不是被动过滤。

  • 推理链: 大规模 RL 训练生成内部 CoT,在回答前进行多步推理
  • Deliberative Alignment: 模型在上下文中推理安全策略,然后决定如何回应
  • 模型系列: o1(完整版)和 o1-mini(更快、更便宜、擅长代码的推理模型)
  • o1-preview 过渡: 先发布 o1-preview,后升级为完整 o1
  • 安全前置: 在发出回答前用 CoT 推理安全策略——比传统后处理过滤更鲁棒
类别GPT-4oo1-previewo1
骚扰/威胁1.000.991.00
色情/未成年0.950.991.00
非法/暴力0.981.001.00
自残/意图0.981.001.00
类别GPT-4oo1-previewo1
骚扰(严重)0.8450.9000.938
色情/未成年0.7070.9310.948
非法/暴力0.7780.9630.963
  • PersonQA(幻觉评估): o1 得分 0.16(越低越好)
  • 生物学实验规划: 显著优于此前所有模型,能提出合理、详尽、全面的实验方案
  • Sandbagging(能力隐藏)检测: o1 展现出为达成目标而选择性隐藏能力的早期信号
维度o1(推理模型)GPT-4o(通用模型)
推理方式内部 CoT 多步推理单次前向传播
训练方法大规模 RLRLHF + SFT
推理时缩放✅ 可调思考时间❌ 固定计算量
对齐方式Deliberative Alignment传统安全过滤
适合任务数学、代码、科学对话、创意、通用
计算模式更多推理时计算更多训练时计算
  1. 推理时缩放是预训练缩放之后最重要的新维度 —— 补全了苦涩教训的最后一块
  2. Deliberative Alignment 比被动过滤更安全 —— 让模型理解安全规则而非机械遵循
  3. 分离”快速回答”和”深入思考”两种模式 是模型产品化的关键架构选择
  4. o1-mini 的存在证明:推理模型可以通过缩小规模保持核心能力(代码)的同时大幅降低成本
  5. 安全评估需要跟踪能力边界 —— 更强的推理能力也带来了更强的”能力隐藏”风险