发布日期: 2023-03-14
来源: arXiv 2303.08774
工程范式: 统一推理模型路线——从 scaling law 可预测性出发走向通用智能。
GPT-4 是 OpenAI 在 GPT 系列中首次引入多模态输入(图像+文本)的大规模模型。其核心哲学是 可预测的 scaling ——通过小模型的性能曲线精确预测大模型行为,从而指导训练资源分配。报告明确提出:“We can accurately predict some aspects of GPT-4’s performance based on models trained with no more than 1/1,000th the compute of GPT-4.” 这意味着 OpenAI 相信 scaling law 不仅是训练阶段的观测规律,更可以作为工程决策的工具。
特定于报告的另一核心信号:因竞争环境和安全考虑,OpenAI 选择 不披露 模型大小、架构细节、训练计算量、数据集构建方法等关键信息,开启了”开源倒退”的新阶段。
- 架构: Transformer-based,预训练目标为预测文档中下一个 token
- 多模态: 接受图像和文本输入,产生文本输出。使用 CLIP 风格的视觉编码器
- 训练后对齐: 通过 RLHF(与 GPT-3.5 相同的方案)进行 post-training
- 安全奖励信号: 在 RLHF 训练中引入额外的安全奖励信号,减少有害输出
- 预测能力: 基于小模型(1/1000 计算量)的性能精确预测最终模型在 HumanEval 等基准上的 pass rate
| 属性 | 推测值 |
|---|
| 参数估计 | ~1.7T(社区广泛引用,非官方确认) |
| 上下文窗口 | 32K(早期),128K(后续更新) |
| 架构类型 | Dense Transformer + MoE(推测) |
| 视觉编码器 | CLIP 变体 |
| 基准 | GPT-4 | GPT-3.5 | 人类专家 |
|---|
| 模拟律师考试 | ~前 10% | ~后 10% | 通过 |
| MMLU | 86.4% | 70.0% | 89.8% |
| HumanEval (Pass@1) | 67.0% | 48.1% | - |
| HellaSwag | 95.3% | 85.5% | - |
| WinoGrande | 87.5% | 81.6% | - |
| 语言 | GPT-4 | GPT-3.5 | 基线 |
|---|
| 意大利语 MMLU | 85.1% | 62.9% | LLaMA 65B 56.1% |
| 法语 MMLU | 84.1% | 62.5% | LLaMA 65B 56.1% |
| 中文 MMLU | 80.1% | 58.3% | LLaMA 65B 43.5% |
- 有害内容拒绝: 相比 GPT-3.5 显著提升
- 真实性: TruthfulQA 上比 GPT-3.5 提高 19%
- 过度拒绝(overrefusal): 在某些安全边界场景仍存在问题
| 维度 | GPT-4 | GPT-3.5 | PaLM 2 |
|---|
| 架构信息公开 | 几乎不公开 | 更少公开 | 较透明 |
| 多模态 | 图像输入+文本输出 | 纯文本 | 纯文本 |
| Scaling 可预测性 | 核心方法 | 无 | 无 |
| 安全报告 | 独立 System Card | 无 | 有 |
- 小模型预测大模型性能是可行的工程方法 —— 用 1/1000 计算量的小模型拟合曲线,可以提前判断 scaling 是否偏离预期
- 安全奖励信号 + RLHF 的组合 是目前最有效的对齐范式
- 不披露架构细节的双刃剑: 保护竞争优势的同时限制了学术研究社区的可复现性,长期可能拖慢整个领域的进步
- 多模态是 GPT 系列的重要方向 —— GPT-4 证明了单一模型处理文本+图像的能力,为 GPT-4V 和后续模型铺路