Seed 1.5-VL — 小参数大能力的多模态推理模型
Seed 1.5-VL: 小参数大能力的多模态推理模型
Section titled “Seed 1.5-VL: 小参数大能力的多模态推理模型”发布日期: 2025-05 (arXiv 2505.07062) 来源: arXiv 2505.07062 工程范式: 参数效率 MoE + 紧凑视觉编码器——532M 视觉编码器 + 20B 激活 MoE LLM,60 项基准中 38 项 SOTA。
Seed 1.5-VL 的核心约束是「小模型做出大能力」——用紧凑的架构(20B 激活参数)在视觉语言任务上挑战 GPT-4o 级别的模型。关键假设:精心设计的训练策略和数据管线可以弥补模型规模的不足。团队选择了 MoE 语言解码器 + 中等规模的视觉编码器的组合。
关键架构决策
Section titled “关键架构决策”- MoonViT(自研): 532M 参数的视觉编码器
- 原生分辨率支持: 不固定输入图像分辨率,自适应处理
- 支持超高清视觉输入的高效处理
MoE 语言模型
Section titled “MoE 语言模型”- 20B 激活参数的 MoE LLM
- 延续 Seed 系列的参数效率路线
- 与视觉编码器紧密集成
- 多阶段训练:视觉-语言对齐 → 多模态 SFT → RLHF
- 数据构建的全面优化
- 在 60 项公共基准上进行评估
- 部署在火山引擎(Volcano Engine)
- 模型 ID:
doubao-1-5-thinking-vision-pro-250428
公共基准表现
Section titled “公共基准表现”- 60 项基准中 38 项达到 SOTA
- 在视觉理解、推理、视频理解等全方位任务中表现领先
Agent 能力
Section titled “Agent 能力”- GUI 控制和游戏玩法等 agent 任务中超越:
- OpenAI CUA
- Claude 3.7
- 特别擅长视觉拼图等多模态推理挑战
- 除视觉和视频理解外,展现强大的推理能力
- 有效处理视觉拼图等多模态推理任务
- 在同类紧凑模型中建立新标准
vs GPT-4o-mini(推测为密集 8B 级),Seed 1.5-VL 的 MoE 架构在相同或更少的激活参数下实现更丰富的知识容量。vs Qwen2.5-VL-7B(7B 密集),Seed 1.5-VL 的 20B 激活 MoE 以更高参数提供更优性能。vs Claude 3.7(闭源旗舰多模态),Seed 1.5-VL 在 agent 场景中能超越。
可复用的工程经验
Section titled “可复用的工程经验”- 小参数的 MoE 视觉语言模型可以通过精细训练追赶大模型——20B 激活 vs 数百 B 密集
- Agent 能力(GUI 控制、游戏)是多模态模型的重要差异化维度
- 视觉编码器的大小(532M)和语言模型的容量需要平衡——过度放大一方会造成瓶颈
- 多阶段训练的精度直接影响最终模型的泛化能力