跳转到内容

Qwen1.5 — 从密集到 MoE 的过渡版本

发布日期: 2024-02 来源: qwenlm.github.io/blog/qwen1.5 工程范式: 密集 + 实验性 MoE 双轨——提供 0.5B 到 110B 的多尺寸覆盖,首次探索 MoE 路线(Qwen1.5-MoE-A2.7B)。

Qwen1.5 是 Qwen 系列向 Qwen2 过渡的中间版本,核心目标是扩充模型尺寸谱系并验证 MoE 路线的可行性。团队发布了 8 种尺寸的密集模型(0.5B~110B)和 1 个 MoE 实验模型。Qwen1.5-MoE-A2.7B 尤为关键——它通过 upcycling 从 Qwen-1.8B 升级而来,以 2.7B 激活参数匹配 7B 密集模型性能。

  • 八种尺寸:0.5B / 1.8B / 4B / 7B / 14B / 32B / 72B / 110B
  • 架构继承 Qwen:Transformer decoder、RoPE、SwiGLU、RMSNorm
  • 改进的对齐质量:SFT + DPO 两阶段训练
  • 多语言能力提升
  • 总参: 约 14B(upcycled from Qwen-1.8B)
  • 激活参数: 2.7B
  • 架构: 4 个共享专家(始终激活)+ 60 个路由专家(激活 4 个)
  • 非嵌入参数: 2.0B(仅为 Qwen1.5-7B 的 1/3)
  • 训练成本: 比 Qwen1.5-7B 降低 75%
  • Hugging Face transformers 原生集成(无需 trust_remote_code
  • 全系列开源
  • 更好的开发者体验
模型对比目标结果
MoE-A2.7B vs Qwen1.5-7B参数 1/3性能匹配
MoE-A2.7B vs Mistral-7B参数 1/3性能匹配
MoE-A2.7B vs Gemma-7B参数 1/3更有竞争力
  • 相比 Qwen1.5-7B:75% 的训练成本降低
  • 验证了 MoE 作为参数效率路线的可行性
  • 为 Qwen2 的 MoE 版本奠定基础
  • 对齐质量显著提升
  • 多语言能力增强
  • 完整的尺寸谱系满足不同部署需求

vs Qwen(2023),Qwen1.5 增加了更多模型尺寸并首次引入 MoE。vs Mistral-7B/Gemma-7B(同期密集 7B),Qwen1.5-MoE-A2.7B 以 1/3 参数实现可比性能。关键洞察:MoE upcycling(从密集模型升级)是比从头训练 MoE 更便宜的路线。

  1. MoE upcycling(从密集模型升级为 MoE)是探索 MoE 路线的最经济方式
  2. 4 共享专家 + 60 路由专家的架构在 2.7B 激活参数下效果最好
  3. 非嵌入参数(2.0B)是比总参数更有意义的效率指标
  4. 模型尺寸谱系的完整性(0.5B~110B)对于开发者采纳至关重要
  5. 与主流框架(Hugging Face)的原生集成降低使用门槛