跳转到内容

Seeduplex — 原生态全双工语音 LLM

发布日期: 2025 来源: seed.bytedance.com/en/blog/introducing-seed-full-duplex-speech-llm 工程范式: 全双工语音技术——「边听边说」的原生框架,实现人类级别的对话自然度。

Seeduplex 的核心洞察是:半双工(half-duplex)语音交互是语音 AI 体验的最大瓶颈。传统语音助手采用「你说话时我不能说,我说话时你不能说」的模式,这与人际交流中「边听边说、可以打断」的体验差距巨大。Seeduplex 选择原生态全双工(full-duplex)建模——让 AI 能同时「听」和「说」。

全双工语音建模(Full Duplex Modeling, FDM)

Section titled “全双工语音建模(Full Duplex Modeling, FDM)”
  • 原生全双工架构:不同于前代豆包端到端语音模型的半双工范式
  • 「边听边说」框架:AI 在输出的同时持续监听用户输入
  • 同时处理用户语音流和 AI 语音流两条输入
  • 结合语音数据的预训练
  • 精心设计的模型架构支持双工行为
  • 两个输入流同时处理:用户语音流 + AI 语音流
  • 编码器设计支持流式处理
  • 延迟尖峰(latency spikes) 的克服
  • 高并发下的稳定性保证
  • 低延迟实时语音交互优化
  • 用户可以在 AI 说话时随时打断(barge-in)
  • AI 在用户说话时可以调整回应(自适应)
  • 背景噪音过滤
  • 更自然的对话节奏控制
指标改进
对话流畅度 MOS提升 12%
过早 AI 回应减少 40%
误响应(噪音触发)减少 50%
打断响应延迟快 300ms
整体通话满意度提升 8.34%
  • 过滤汽车导航、电视、他人对话等背景噪音
  • 误响应减少 50%
  • AI 能精准响应用户语音请求,不被环境噪音干扰
  • 已部署到豆包等字节跳动产品
  • 支持大规模并发下的实时语音交互

vs 传统半双工语音助手(Siri、Google Assistant、Alexa 等),Seeduplex 实现了质的飞跃——从「轮流说话」到「边听边说」。vs GPT-4o 语音模式(OpenAI,也实现了多模态语音),Seeduplex 更专注于全双工的工程优化而非通用智能。核心差异化:Seeduplex 是真正原生态的全双工,而非半双工的事后补丁。

  1. 语音交互的瓶颈不是语音识别准确率,而是交互范式——半双工到全双工的转换是用户体验的阶跃提升
  2. 全双工的工程挑战主要在延迟和稳定性——高并发下的实时双流处理需要系统级优化
  3. 噪音抑制在全双工模式下比半双工困难得多——因为 AI 在说话时也要「听」
  4. 打断(barge-in)的自然度直接影响用户满意度——300ms 的延迟差异就能被用户感知
  5. 从半双工到全双工需要重新设计模型架构——不能简单地在半双工系统上叠加功能