GPT-4o — Omni 模型与实时语音
GPT-4o System Card
Section titled “GPT-4o System Card”发布日期: 2024-05-13
来源: arXiv 2410.21276 / cdn.openai.com
工程范式: 统一推理模型路线——第一个真正的全模态(Omni)模型。
GPT-4o(“o”代表 omni)是 OpenAI 首个 端到端全模态 模型,接受文本、音频、图像、视频输入的任意组合,并生成文本、音频、图像输出的任意组合。核心创新是 统一神经网络处理所有模态,而非用独立模块拼装。
语音延迟的突破性意义:平均 320ms(低至 232ms)的音频响应时间,接近人类对话反应速度。这使得 AI 语音交互从”可用”变为”自然”。
经济设计:API 价格比 GPT-4 Turbo 降低 50%,同时性能匹配或超越。
关键架构决策
Section titled “关键架构决策”- 架构: Autoregressive Omni Model——端到端训练,覆盖文本、视觉、音频
- 语音处理: 原生端到端,非传统的 ASR → LLM → TTS 流水线;模型直接学习音频输入到音频输出的映射
- 视觉: 比 GPT-4 Turbo 显著更强
- 多语言: 非英语文本显著提升(相比 GPT-4 Turbo)
- 安全设计: 专为语音模态设计的过滤器——音乐输出阻断、声音属性不变性(hedging敏感特质归因)
| 指标 | GPT-4o | GPT-4 Turbo |
|---|---|---|
| 音频响应延迟(平均) | 320ms | N/A |
| 音频响应延迟(最低) | 232ms | N/A |
| 英文文本/代码 | 匹配 | 基线 |
| 非英语文本 | 显著提升 | 基线 |
| 视觉能力 | 显著提升 | 基线 |
| API 价格 | -50% | 基线 |
安全评估结果
Section titled “安全评估结果”语音模式安全
Section titled “语音模式安全”| 类别 | GPT-4o (post-mitigation) |
|---|---|
| 色情/未成年 | 0.99 not_unsafe |
| 极端主义/宣传 | 1.00 not_unsafe |
| 非法/暴力 | 1.00 not_unsafe |
| 自残/指令 | 0.99 not_unsafe |
XSTest(过度拒绝)
Section titled “XSTest(过度拒绝)”| 类别 | GPT-4o | GPT-4 Turbo |
|---|---|---|
| 整体 | 0.924 | - |
| 隐私/虚构 | 0.44 | - |
| 安全上下文 | 0.96 | - |
| 维度 | GPT-4o | GPT-4 Turbo | Claude 3 |
|---|---|---|---|
| 音频输入 | 原生 | ❌ | ❌ |
| 音频输出 | 原生 | ❌ | ❌ |
| 端到端语音 | ✅ | ASR pipeline | ❌ |
| 延迟目标 | 人类水平 | N/A | N/A |
| 多语言 | 显著提升 | 基准 | 基准 |
可复用的工程经验
Section titled “可复用的工程经验”- 端到端全模态训练的时机已到 —— 不再需要独立的 ASR/TTS/LLM 拼接
- 低延迟(<500ms)是语音交互体验的硬门槛 —— GPT-4o 证明原生模型可以做到
- 安全过滤需要为每个新增模态设计专属方案 —— 语音带来了音乐版权、声音模仿等新风险维度
- 一个模型做所有事的统一架构不仅在能力上可行,在成本上也可行(API 价格减半的同时能力不减)
- Advanced Voice Mode 的”不唱歌”指令是一个精巧的约束设计 —— 用简单规则覆盖复杂的版权风险