Janus-Pro — 数据和模型规模驱动的统一多模态升级
Janus-Pro
Section titled “Janus-Pro”发布日期: 2025-01-28 来源: arXiv 2501.17811 工程范式: 数据规模 × 模型规模 × 训练策略优化的三维扩展。
Janus-Pro 不是架构创新,而是验证了统一多模态模型的可扩展性(scalability)。核心思路三点:一是修复 Janus 训练策略的次优设计——移除 Stage II 中间 ImageNet 预训练步骤、调整 Stage III 数据配比(从 7:3:10 改为 5:1:4)。二是数据扩展——加入约 9000 万条多模态样本(YFCC、Docmatix、DeepSeek-VL2)和约 7200 万条合成美学图像-文本对(1:1 真实:合成),重点解决生成质量不稳定和美学评分低的问题。三是模型扩展——从 1.5B LLM 扩展到 7B,验证了架构在大模型下的收敛加速特性。
关键架构决策
Section titled “关键架构决策”- 架构不变: 与 Janus 相同——SigLIP-L(理解)+ VQ tokenizer(生成)+ 解耦 adaptor + 统一自回归 LLM
- 数据配比: Stage III 从 7:3:10 改为 5:1:4(多模态:文本:生成),减少生成比例以提升理解性能
- 合成美学数据: 基于 Midjourney prompt 数据集生成约 7200 万合成图像-文本对,解决真实数据噪声问题
- 计算资源: 1.5B/7B 分别用 16/32 节点 × 8×A100-40G,训练约 9/14 天
Janus-Pro-7B MMBench 达 79.2(Janus 1.3B 69.4),GenEval 达 0.80(Janus 0.61,超越 DALL-E 3 的 0.67 和 SD3-Medium 的 0.74),DPG-Bench 达 84.19(超越 SD3-Medium 84.08 和 DALL-E 3 83.50)。合成美学数据使 FID 从 10.47 降至 9.35。
与 Janus 相比,Janus-Pro 证明了解耦架构的可扩展性——参数增加和高质量数据投入可直接转化为性能提升。与 TokenFlow、MetaMorph 等同期统一多模态模型相比,Janus-Pro 在理解和生成双任务上全面领先。
可复用工程经验
Section titled “可复用工程经验”- 统一多模态模型的可扩展性不被架构设计所限——大模型+大数据有效
- 合成美学数据是提升生成质量和稳定性的廉价方案
- 训练策略优化(数据配比、阶段设计)的收益可与模型扩展媲美
- 移除次优训练步骤(如 ImageNet 中间阶段)能节省可观算力