Seeduplex — 原生态全双工语音 LLM
Seeduplex: 原生态全双工语音 LLM
Section titled “Seeduplex: 原生态全双工语音 LLM”发布日期: 2025 来源: seed.bytedance.com/en/blog/introducing-seed-full-duplex-speech-llm 工程范式: 全双工语音技术——「边听边说」的原生框架,实现人类级别的对话自然度。
Seeduplex 的核心洞察是:半双工(half-duplex)语音交互是语音 AI 体验的最大瓶颈。传统语音助手采用「你说话时我不能说,我说话时你不能说」的模式,这与人际交流中「边听边说、可以打断」的体验差距巨大。Seeduplex 选择原生态全双工(full-duplex)建模——让 AI 能同时「听」和「说」。
关键架构决策
Section titled “关键架构决策”全双工语音建模(Full Duplex Modeling, FDM)
Section titled “全双工语音建模(Full Duplex Modeling, FDM)”- 原生全双工架构:不同于前代豆包端到端语音模型的半双工范式
- 「边听边说」框架:AI 在输出的同时持续监听用户输入
- 同时处理用户语音流和 AI 语音流两条输入
模型架构创新
Section titled “模型架构创新”- 结合语音数据的预训练
- 精心设计的模型架构支持双工行为
- 两个输入流同时处理:用户语音流 + AI 语音流
- 编码器设计支持流式处理
工程挑战解决
Section titled “工程挑战解决”- 延迟尖峰(latency spikes) 的克服
- 高并发下的稳定性保证
- 低延迟实时语音交互优化
- 用户可以在 AI 说话时随时打断(barge-in)
- AI 在用户说话时可以调整回应(自适应)
- 背景噪音过滤
- 更自然的对话节奏控制
交互质量提升
Section titled “交互质量提升”| 指标 | 改进 |
|---|---|
| 对话流畅度 MOS | 提升 12% |
| 过早 AI 回应 | 减少 40% |
| 误响应(噪音触发) | 减少 50% |
| 打断响应延迟 | 快 300ms |
| 整体通话满意度 | 提升 8.34% |
- 过滤汽车导航、电视、他人对话等背景噪音
- 误响应减少 50%
- AI 能精准响应用户语音请求,不被环境噪音干扰
- 已部署到豆包等字节跳动产品
- 支持大规模并发下的实时语音交互
vs 传统半双工语音助手(Siri、Google Assistant、Alexa 等),Seeduplex 实现了质的飞跃——从「轮流说话」到「边听边说」。vs GPT-4o 语音模式(OpenAI,也实现了多模态语音),Seeduplex 更专注于全双工的工程优化而非通用智能。核心差异化:Seeduplex 是真正原生态的全双工,而非半双工的事后补丁。
可复用的工程经验
Section titled “可复用的工程经验”- 语音交互的瓶颈不是语音识别准确率,而是交互范式——半双工到全双工的转换是用户体验的阶跃提升
- 全双工的工程挑战主要在延迟和稳定性——高并发下的实时双流处理需要系统级优化
- 噪音抑制在全双工模式下比半双工困难得多——因为 AI 在说话时也要「听」
- 打断(barge-in)的自然度直接影响用户满意度——300ms 的延迟差异就能被用户感知
- 从半双工到全双工需要重新设计模型架构——不能简单地在半双工系统上叠加功能