跳转到内容

GPT-4o — Omni 模型与实时语音

发布日期: 2024-05-13
来源: arXiv 2410.21276 / cdn.openai.com
工程范式: 统一推理模型路线——第一个真正的全模态(Omni)模型。

GPT-4o(“o”代表 omni)是 OpenAI 首个 端到端全模态 模型,接受文本、音频、图像、视频输入的任意组合,并生成文本、音频、图像输出的任意组合。核心创新是 统一神经网络处理所有模态,而非用独立模块拼装。

语音延迟的突破性意义:平均 320ms(低至 232ms)的音频响应时间,接近人类对话反应速度。这使得 AI 语音交互从”可用”变为”自然”。

经济设计:API 价格比 GPT-4 Turbo 降低 50%,同时性能匹配或超越。

  • 架构: Autoregressive Omni Model——端到端训练,覆盖文本、视觉、音频
  • 语音处理: 原生端到端,非传统的 ASR → LLM → TTS 流水线;模型直接学习音频输入到音频输出的映射
  • 视觉: 比 GPT-4 Turbo 显著更强
  • 多语言: 非英语文本显著提升(相比 GPT-4 Turbo)
  • 安全设计: 专为语音模态设计的过滤器——音乐输出阻断、声音属性不变性(hedging敏感特质归因)
指标GPT-4oGPT-4 Turbo
音频响应延迟(平均)320msN/A
音频响应延迟(最低)232msN/A
英文文本/代码匹配基线
非英语文本显著提升基线
视觉能力显著提升基线
API 价格-50%基线
类别GPT-4o (post-mitigation)
色情/未成年0.99 not_unsafe
极端主义/宣传1.00 not_unsafe
非法/暴力1.00 not_unsafe
自残/指令0.99 not_unsafe
类别GPT-4oGPT-4 Turbo
整体0.924-
隐私/虚构0.44-
安全上下文0.96-
维度GPT-4oGPT-4 TurboClaude 3
音频输入原生
音频输出原生
端到端语音ASR pipeline
延迟目标人类水平N/AN/A
多语言显著提升基准基准
  1. 端到端全模态训练的时机已到 —— 不再需要独立的 ASR/TTS/LLM 拼接
  2. 低延迟(<500ms)是语音交互体验的硬门槛 —— GPT-4o 证明原生模型可以做到
  3. 安全过滤需要为每个新增模态设计专属方案 —— 语音带来了音乐版权、声音模仿等新风险维度
  4. 一个模型做所有事的统一架构不仅在能力上可行,在成本上也可行(API 价格减半的同时能力不减)
  5. Advanced Voice Mode 的”不唱歌”指令是一个精巧的约束设计 —— 用简单规则覆盖复杂的版权风险