Janus — 解耦视觉编码实现统一理解与生成
发布日期: 2024-10-17 来源: arXiv 2410.13848 工程范式: 解耦视觉编码通路,在统一自回归框架内实现多模态理解与图像生成。
Janus 解决了统一多模态模型的核心矛盾:理解和生成对视觉编码的要求截然不同——理解需要高层语义抽象,生成需要细粒度像素级信息。此前方案(如 Show-o、Transfusion)试图用同一编码器处理两者,导致性能妥协。Janus 的洞察是:在统一 Transformer 架构下,可以解耦视觉编码器,让 SigLIP 负责理解、VQ tokenizer 负责生成,通过不同的 adaptor 映射到 LLM 的统一表示空间。设计极其简洁——不改变 LLM 结构,只在前端做解耦,后端保留统一自回归训练。
关键架构决策
Section titled “关键架构决策”- 理解编码器: SigLIP-Large-Patch16-384(语义特征)
- 生成编码器: VQ tokenizer(codebook=16384,下采样 16x,来自 LlamaGen),支持图像 token 序列化
- 统一 LLM: 标准自回归 Transformer,图像预测使用独立 head
- 三阶段训练: Stage I 训练 adaptor + image head;Stage II 联合预训练(数据配比 2:3:5,文本:理解:生成);Stage III SFT(配比 7:3:10)
仅 1.3B 参数,Janus 在 MMBench 达 69.4、MME-P 达 1338,超越 LLaVA-v1.5 7B 和 Show-o 1.3B。生成方面 GenEval 综合 0.61(超越 SDXL 的 0.55 和 Show-o 的 0.53),MSCOCO FID 8.53。消融实验证实解耦设计(Exp D)在理解任务上全面优于单一编码器方案(Exp A/B)。
与 Show-o(统一 VQ 编码)相比,Janus 的解耦设计使理解能力提升 30%+。与 LLaVA(仅理解无生成)相比,Janus 以相近参数量同时实现生成能力。
可复用工程经验
Section titled “可复用工程经验”- 解耦视觉编码是统一理解-生成模型的最优起点,实现简单、效果显著
- 编码器解耦不意味着架构复杂化——前端分离、后端统一的设计可扩展性强
- 训练数据配比至关重要,生成任务需要足够占比才能收敛