Qwen1.5 — 从密集到 MoE 的过渡版本
Qwen1.5: 从密集到 MoE 的过渡版本
Section titled “Qwen1.5: 从密集到 MoE 的过渡版本”发布日期: 2024-02 来源: qwenlm.github.io/blog/qwen1.5 工程范式: 密集 + 实验性 MoE 双轨——提供 0.5B 到 110B 的多尺寸覆盖,首次探索 MoE 路线(Qwen1.5-MoE-A2.7B)。
Qwen1.5 是 Qwen 系列向 Qwen2 过渡的中间版本,核心目标是扩充模型尺寸谱系并验证 MoE 路线的可行性。团队发布了 8 种尺寸的密集模型(0.5B~110B)和 1 个 MoE 实验模型。Qwen1.5-MoE-A2.7B 尤为关键——它通过 upcycling 从 Qwen-1.8B 升级而来,以 2.7B 激活参数匹配 7B 密集模型性能。
关键架构决策
Section titled “关键架构决策”密集模型系列
Section titled “密集模型系列”- 八种尺寸:0.5B / 1.8B / 4B / 7B / 14B / 32B / 72B / 110B
- 架构继承 Qwen:Transformer decoder、RoPE、SwiGLU、RMSNorm
- 改进的对齐质量:SFT + DPO 两阶段训练
- 多语言能力提升
MoE 实验模型(Qwen1.5-MoE-A2.7B)
Section titled “MoE 实验模型(Qwen1.5-MoE-A2.7B)”- 总参: 约 14B(upcycled from Qwen-1.8B)
- 激活参数: 2.7B
- 架构: 4 个共享专家(始终激活)+ 60 个路由专家(激活 4 个)
- 非嵌入参数: 2.0B(仅为 Qwen1.5-7B 的 1/3)
- 训练成本: 比 Qwen1.5-7B 降低 75%
- Hugging Face transformers 原生集成(无需
trust_remote_code) - 全系列开源
- 更好的开发者体验
Qwen1.5-MoE-A2.7B 性能
Section titled “Qwen1.5-MoE-A2.7B 性能”| 模型 | 对比目标 | 结果 |
|---|---|---|
| MoE-A2.7B vs Qwen1.5-7B | 参数 1/3 | 性能匹配 |
| MoE-A2.7B vs Mistral-7B | 参数 1/3 | 性能匹配 |
| MoE-A2.7B vs Gemma-7B | 参数 1/3 | 更有竞争力 |
训练成本降低
Section titled “训练成本降低”- 相比 Qwen1.5-7B:75% 的训练成本降低
- 验证了 MoE 作为参数效率路线的可行性
- 为 Qwen2 的 MoE 版本奠定基础
密集模型改进
Section titled “密集模型改进”- 对齐质量显著提升
- 多语言能力增强
- 完整的尺寸谱系满足不同部署需求
vs Qwen(2023),Qwen1.5 增加了更多模型尺寸并首次引入 MoE。vs Mistral-7B/Gemma-7B(同期密集 7B),Qwen1.5-MoE-A2.7B 以 1/3 参数实现可比性能。关键洞察:MoE upcycling(从密集模型升级)是比从头训练 MoE 更便宜的路线。
可复用的工程经验
Section titled “可复用的工程经验”- MoE upcycling(从密集模型升级为 MoE)是探索 MoE 路线的最经济方式
- 4 共享专家 + 60 路由专家的架构在 2.7B 激活参数下效果最好
- 非嵌入参数(2.0B)是比总参数更有意义的效率指标
- 模型尺寸谱系的完整性(0.5B~110B)对于开发者采纳至关重要
- 与主流框架(Hugging Face)的原生集成降低使用门槛