跳转到内容

Seedream 2.0 — 双语图像生成基础模型

Seedream 2.0: 双语图像生成基础模型

Section titled “Seedream 2.0: 双语图像生成基础模型”

发布日期: 2025-03 (arXiv 2503.07703) 来源: arXiv 2503.07703 工程范式: 原生中英双语 + LLM 文本编码器——自研双语 LLM 作为文本编码器,实现文化敏感的跨语言图像生成。

Seedream 2.0 的核心驱动力是现有图像生成模型的中文理解短板——Flux、SD3.5、Midjourney 等主流模型对中国文化元素(如灯笼、汉字排版)的理解严重不足。Seedream 2.0 选择使用自研双语 LLM 作为文本编码器,让模型直接从海量数据中学习中文文化知识。这是「语言能力决定图像质量」的设计思想的体现。

  • 使用自研双语大语言模型作为文本编码器(代替 CLIP/T5)
  • 直接从大规模语料中学习本机知识
  • 支持中英双语图像生成和文本渲染
  • Glyph-Aligned ByT5:灵活的字符级文本渲染
  • Scaled RoPE:泛化到未训练的图像分辨率
  • 混合分辨率训练:支持多种输出分辨率
  • 知识集成(Knowledge Integration):处理数十亿级多模态中英文数据
  • 描述平衡系统:在描述准确性和丰富性之间平衡
  • 缺陷感知训练范式
  1. 预训练阶段:混合分辨率训练、跨模态 RoPE、表示对齐损失、分辨率感知时间步采样
  2. SFT 阶段:多样化美学描述
  3. RLHF 阶段:VLM-based 奖励模型 + 缩放
  4. 可适配为指令式图像编辑模型(SeedEdit)
  • 自研 Bench-240 基准(聚焦文本-图像对齐、结构准确性、美学质量)
  • 综合主观和客观评估
维度表现
提示遵循SOTA
美学效果SOTA
文本渲染SOTA
结构准确性SOTA
ELO 评分出色(多次 RLHF 迭代后)
  • 精准理解中国文化元素
  • 高质量中文文字渲染(困扰大多数西方模型的问题)
  • 自然的中文视觉表达和美学
  • 2024 年 12 月初上线豆包 App 和 Jimeng 平台
  • 支持真实场景中的图像生成需求

vs Flux/SD3.5/Midjourney(主要面向英文市场),Seedream 2.0 的核心差异化是原生的中文支持和文化理解。vs DALL-E 3(OpenAI,密集文本编码器),Seedream 使用自研 LLM 作为文本编码器,这种设计选择使其在中文场景中显著领先。核心洞察:文本编码器的语言能力直接决定了图像生成的文化准确性

  1. 图像生成的语言和文化缺口是真实的工程问题——LLM 作为文本编码器比 CLIP 更适合处理文化敏感内容
  2. 双语文本编码器的训练数据质量和规模直接影响生成的文化准确性
  3. Glyph-Aligned ByT5 + Scaled RoPE 是解决文本渲染和分辨率泛化的有效组合
  4. 知识集成(Knowledge Integration)数据框架适用于多语言多模态数据——主动融合知识而非被动收集
  5. VLM-based 奖励模型可以超越传统 CLIP 评分