跳转到内容

Seedance 1.0 — 视频生成基础模型

发布日期: 2025-06 (arXiv 2506.09113) 来源: arXiv 2506.09113 工程范式: 扩散模型 + 视频专用 RLHF——多源数据策展、高效架构、视频专用奖励机制。

Seedance 1.0 的核心命题是解决视频生成的三元悖论(Trilemma):提示遵循、运动合理性和视觉质量三者难以兼得。传统视频生成模型往往在某一维度上显著落后。Seedance 选择通过高效的架构设计 + 视频特化的后训练优化(RLHF) 来同时优化三个维度。

  1. 多源数据策展 + 精确视频描述:增强跨场景的综合学习

    • 数据清洗管线确保视频-文本对齐质量
    • 精确 caption 模型自动生成训练数据的视频描述
  2. 高效架构设计 + 训练范式

    • 原生支持多镜头(multi-shot)生成
    • 统一框架同时学习文生视频(T2V)图生视频(I2V)
    • 双语(中/英文)支持
  3. 视频专用后训练优化

    • 细粒度 SFT
    • 多维奖励机制的视频专用 RLHF
  4. 推理加速

    • 多阶段蒸馏策略 + 系统级优化
    • ~10 倍推理加速
  • 生成 1080p 的 5 秒视频仅需 41.4 秒(NVIDIA L20 GPU)
  • 高分辨率下的合理推理时间
  • 上线豆包 App 和 Jimeng 平台
  • 被 Artificial Analysis 评为 T2V 和 I2V 双榜第一
  • 在内部 SeedVideoBench-1.0 和第三方平台 Artificial Analysis 上表现优异
  • T2V 任务:提示遵循、运动质量、美学效果均获高分
  • I2V 任务:同样领先
  • Artificial Analysis T2V 和 I2V 双榜排名第一
  • 支持多风格生成(写实、动画、电影、广告)
  • 精准的提示遵循(多主体交互、复杂动作序列、丰富镜头语言)
  • 多镜头叙事连贯性(主体一致)
  • 超大动态范围——从细微表情到大幅度动作均保持稳定
  • 多镜头叙事一致性——镜头切换时主体保持一致

vs Sora(OpenAI,推测为 diffusion transformer),Seedance 更注重推理效率(10× 加速)和实用部署。vs Kling(快手),Seedance 的双语能力和 RLHF 后训练是差异化优势。vs Veo(Google),Seedance 在推理速度和开源程度上更友好。核心差异:10× 推理加速使 Seedance 在消费级 GPU 上可用。

  1. 视频生成的三元悖论需要联合优化——不能只优化一个维度
  2. 视频专用的多维奖励 RLHF 比通用 RLHF 更有效
  3. 多阶段蒸馏可以将推理成本降低一个数量级
  4. 统一 T2V 和 I2V 训练可以互相增强两个任务的表现
  5. 精确的视频描述(captioning)是训练数据质量的关键瓶颈