DeepSeek-VL — 混合视觉编码与语言保持训练策略
DeepSeek-VL
Section titled “DeepSeek-VL”发布日期: 2024-03-08 来源: arXiv 2403.05525 工程范式: 混合视觉编码器 + 模态 warm-up + 分类法驱动的指令数据构建。
DeepSeek-VL 面临多模态模型的核心矛盾:视觉理解需要高语义特征(来自低分辨率编码器),视觉细节需要高分辨率特征,但单一编码器无法兼顾两者。解决方案是混合两个视觉编码器——SigLIP-L(384x384)提取语义,SAM-B(1024x1024)提取细节。另一关键洞察是直接做多模态训练会严重退化语言能力(MMLU 从 50% 降至接近 0%),因此提出”模态混合比率”控制——70% 文本数据 + 30% 多模态数据,并配以模态 warm-up 策略稳定训练。
关键架构决策
Section titled “关键架构决策”- 视觉编码: SigLIP-L(384x384, 576 tokens)+ SAM-B(1024x1024, 576 tokens),拼接后由 2 层 MLP 映射到 LLM 输入空间
- token 压缩: 1024x1024 图像压缩为 576 tokens,平衡视觉信息保留和计算开销
- LLM: DeepSeek LLM 1B/7B(Pre-Norm + RMSNorm + SwiGLU + RoPE)
- 指令数据: 基于真实用户对 GPT-4V 的 prompt 构建使用场景分类法(8 大类 20+ 子类),覆盖识别、转换、分析、常识推理、逻辑推理等
DeepSeek-VL 7B 在多模态基准上达到同类规模 SOTA:MMB 76.1%、MM-Vet 44.6%。与 LLaVA-v1.5 7B 相比,在 OCR 和文档理解任务上有明显优势。同时语言能力几乎无损——MMLU 仅下降不到 1%。
与 LLaVA(单 SigLIP/CLIP 编码器)相比,DeepSeek-VL 的双编码器设计在需要细粒度视觉理解的任务上优势明显。与 Qwen-VL 相比,模态 warm-up 策略更具工程可迁移性。共享 GPT-4V 使用场景分类法构建指令数据的方法极具借鉴价值。
可复用工程经验
Section titled “可复用工程经验”- 多模态训练必须保留足够文本数据(~70%)防止语言灾难性遗忘
- 模态 warm-up(逐步增加视觉数据比例)能稳定训练过程
- 混合视觉编码器方案实现简单、效果显著,比单一大编码器更灵活
- 用分类法驱动指令数据构建比盲目收集更高效