Seedance 1.0 — 视频生成基础模型
Seedance 1.0: 视频生成基础模型
Section titled “Seedance 1.0: 视频生成基础模型”发布日期: 2025-06 (arXiv 2506.09113) 来源: arXiv 2506.09113 工程范式: 扩散模型 + 视频专用 RLHF——多源数据策展、高效架构、视频专用奖励机制。
Seedance 1.0 的核心命题是解决视频生成的三元悖论(Trilemma):提示遵循、运动合理性和视觉质量三者难以兼得。传统视频生成模型往往在某一维度上显著落后。Seedance 选择通过高效的架构设计 + 视频特化的后训练优化(RLHF) 来同时优化三个维度。
关键架构决策
Section titled “关键架构决策”视频生成三元悖论的解决方案
Section titled “视频生成三元悖论的解决方案”-
多源数据策展 + 精确视频描述:增强跨场景的综合学习
- 数据清洗管线确保视频-文本对齐质量
- 精确 caption 模型自动生成训练数据的视频描述
-
高效架构设计 + 训练范式
- 原生支持多镜头(multi-shot)生成
- 统一框架同时学习文生视频(T2V)和图生视频(I2V)
- 双语(中/英文)支持
-
视频专用后训练优化
- 细粒度 SFT
- 多维奖励机制的视频专用 RLHF
-
推理加速
- 多阶段蒸馏策略 + 系统级优化
- ~10 倍推理加速
- 生成 1080p 的 5 秒视频仅需 41.4 秒(NVIDIA L20 GPU)
- 高分辨率下的合理推理时间
- 上线豆包 App 和 Jimeng 平台
- 被 Artificial Analysis 评为 T2V 和 I2V 双榜第一
- 在内部 SeedVideoBench-1.0 和第三方平台 Artificial Analysis 上表现优异
- T2V 任务:提示遵循、运动质量、美学效果均获高分
- I2V 任务:同样领先
- Artificial Analysis T2V 和 I2V 双榜排名第一
- 支持多风格生成(写实、动画、电影、广告)
- 精准的提示遵循(多主体交互、复杂动作序列、丰富镜头语言)
- 多镜头叙事连贯性(主体一致)
- 超大动态范围——从细微表情到大幅度动作均保持稳定
- 多镜头叙事一致性——镜头切换时主体保持一致
vs Sora(OpenAI,推测为 diffusion transformer),Seedance 更注重推理效率(10× 加速)和实用部署。vs Kling(快手),Seedance 的双语能力和 RLHF 后训练是差异化优势。vs Veo(Google),Seedance 在推理速度和开源程度上更友好。核心差异:10× 推理加速使 Seedance 在消费级 GPU 上可用。
可复用的工程经验
Section titled “可复用的工程经验”- 视频生成的三元悖论需要联合优化——不能只优化一个维度
- 视频专用的多维奖励 RLHF 比通用 RLHF 更有效
- 多阶段蒸馏可以将推理成本降低一个数量级
- 统一 T2V 和 I2V 训练可以互相增强两个任务的表现
- 精确的视频描述(captioning)是训练数据质量的关键瓶颈