跳转到内容

GPT-4 — Scaling Law Prediction & Multimodal First Step

发布日期: 2023-03-14
来源: arXiv 2303.08774
工程范式: 统一推理模型路线——从 scaling law 可预测性出发走向通用智能。

GPT-4 是 OpenAI 在 GPT 系列中首次引入多模态输入(图像+文本)的大规模模型。其核心哲学是 可预测的 scaling ——通过小模型的性能曲线精确预测大模型行为,从而指导训练资源分配。报告明确提出:“We can accurately predict some aspects of GPT-4’s performance based on models trained with no more than 1/1,000th the compute of GPT-4.” 这意味着 OpenAI 相信 scaling law 不仅是训练阶段的观测规律,更可以作为工程决策的工具。

特定于报告的另一核心信号:因竞争环境和安全考虑,OpenAI 选择 不披露 模型大小、架构细节、训练计算量、数据集构建方法等关键信息,开启了”开源倒退”的新阶段。

  • 架构: Transformer-based,预训练目标为预测文档中下一个 token
  • 多模态: 接受图像和文本输入,产生文本输出。使用 CLIP 风格的视觉编码器
  • 训练后对齐: 通过 RLHF(与 GPT-3.5 相同的方案)进行 post-training
  • 安全奖励信号: 在 RLHF 训练中引入额外的安全奖励信号,减少有害输出
  • 预测能力: 基于小模型(1/1000 计算量)的性能精确预测最终模型在 HumanEval 等基准上的 pass rate
属性推测值
参数估计~1.7T(社区广泛引用,非官方确认)
上下文窗口32K(早期),128K(后续更新)
架构类型Dense Transformer + MoE(推测)
视觉编码器CLIP 变体
基准GPT-4GPT-3.5人类专家
模拟律师考试~前 10%~后 10%通过
MMLU86.4%70.0%89.8%
HumanEval (Pass@1)67.0%48.1%-
HellaSwag95.3%85.5%-
WinoGrande87.5%81.6%-
语言GPT-4GPT-3.5基线
意大利语 MMLU85.1%62.9%LLaMA 65B 56.1%
法语 MMLU84.1%62.5%LLaMA 65B 56.1%
中文 MMLU80.1%58.3%LLaMA 65B 43.5%
  • 有害内容拒绝: 相比 GPT-3.5 显著提升
  • 真实性: TruthfulQA 上比 GPT-3.5 提高 19%
  • 过度拒绝(overrefusal): 在某些安全边界场景仍存在问题
维度GPT-4GPT-3.5PaLM 2
架构信息公开几乎不公开更少公开较透明
多模态图像输入+文本输出纯文本纯文本
Scaling 可预测性核心方法
安全报告独立 System Card
  1. 小模型预测大模型性能是可行的工程方法 —— 用 1/1000 计算量的小模型拟合曲线,可以提前判断 scaling 是否偏离预期
  2. 安全奖励信号 + RLHF 的组合 是目前最有效的对齐范式
  3. 不披露架构细节的双刃剑: 保护竞争优势的同时限制了学术研究社区的可复现性,长期可能拖慢整个领域的进步
  4. 多模态是 GPT 系列的重要方向 —— GPT-4 证明了单一模型处理文本+图像的能力,为 GPT-4V 和后续模型铺路