跳转到内容

Seed 1.5-VL — 小参数大能力的多模态推理模型

Seed 1.5-VL: 小参数大能力的多模态推理模型

Section titled “Seed 1.5-VL: 小参数大能力的多模态推理模型”

发布日期: 2025-05 (arXiv 2505.07062) 来源: arXiv 2505.07062 工程范式: 参数效率 MoE + 紧凑视觉编码器——532M 视觉编码器 + 20B 激活 MoE LLM,60 项基准中 38 项 SOTA。

Seed 1.5-VL 的核心约束是「小模型做出大能力」——用紧凑的架构(20B 激活参数)在视觉语言任务上挑战 GPT-4o 级别的模型。关键假设:精心设计的训练策略和数据管线可以弥补模型规模的不足。团队选择了 MoE 语言解码器 + 中等规模的视觉编码器的组合。

  • MoonViT(自研): 532M 参数的视觉编码器
  • 原生分辨率支持: 不固定输入图像分辨率,自适应处理
  • 支持超高清视觉输入的高效处理
  • 20B 激活参数的 MoE LLM
  • 延续 Seed 系列的参数效率路线
  • 与视觉编码器紧密集成
  • 多阶段训练:视觉-语言对齐 → 多模态 SFT → RLHF
  • 数据构建的全面优化
  • 在 60 项公共基准上进行评估
  • 部署在火山引擎(Volcano Engine)
  • 模型 ID:doubao-1-5-thinking-vision-pro-250428
  • 60 项基准中 38 项达到 SOTA
  • 在视觉理解、推理、视频理解等全方位任务中表现领先
  • GUI 控制游戏玩法等 agent 任务中超越:
    • OpenAI CUA
    • Claude 3.7
  • 特别擅长视觉拼图等多模态推理挑战
  • 除视觉和视频理解外,展现强大的推理能力
  • 有效处理视觉拼图等多模态推理任务
  • 在同类紧凑模型中建立新标准

vs GPT-4o-mini(推测为密集 8B 级),Seed 1.5-VL 的 MoE 架构在相同或更少的激活参数下实现更丰富的知识容量。vs Qwen2.5-VL-7B(7B 密集),Seed 1.5-VL 的 20B 激活 MoE 以更高参数提供更优性能。vs Claude 3.7(闭源旗舰多模态),Seed 1.5-VL 在 agent 场景中能超越。

  1. 小参数的 MoE 视觉语言模型可以通过精细训练追赶大模型——20B 激活 vs 数百 B 密集
  2. Agent 能力(GUI 控制、游戏)是多模态模型的重要差异化维度
  3. 视觉编码器的大小(532M)和语言模型的容量需要平衡——过度放大一方会造成瓶颈
  4. 多阶段训练的精度直接影响最终模型的泛化能力