Qwen2 — 密集 + MoE 双旗舰
Qwen2: 密集 + MoE 双旗舰
Section titled “Qwen2: 密集 + MoE 双旗舰”发布日期: 2024-07 (arXiv 2407.10671) 来源: arXiv 2407.10671 工程范式: 密集 + MoE 双轨并行——57B 总参/14B 激活的 MoE 与 72B 密集旗舰互补,覆盖不同部署场景。
Qwen2 的核心战略是双轨并行——同时发布密集(0.5B~72B)和 MoE(57B-A14B)两种架构的旗舰模型,让开发者根据部署约束选择。关键架构升级包括:GQA(分组查询注意力)、DCA + YARN(127K 超长上下文)、Fine-grained MoE 专家设计。
关键架构决策
Section titled “关键架构决策”Dense 模型
Section titled “Dense 模型”| 尺寸 | 隐藏层 | 层数 | Q 头 | KV 头 | 训练 tokens |
|---|---|---|---|---|---|
| 0.5B | 896 | 24 | 14 | 2 | 12T |
| 1.5B | 1,536 | 28 | 12 | 2 | 7T |
| 7B | 3,584 | 28 | 28 | 4 | 7T |
| 72B | 8,192 | 80 | 64 | 8 | 7T |
MoE 模型(Qwen2-57B-A14B)
Section titled “MoE 模型(Qwen2-57B-A14B)”- 总参: 57B,激活参数: 14B
- Fine-grained experts:64 个路由专家 + 8 个共享专家,8 个激活
- 专家初始化:从密集模型 upcycling,参数 shuffle + 50% 随机重新初始化
- 额外训练 4.5T tokens(在 7T 预训练基础上)
架构升级(vs Qwen1.5)
Section titled “架构升级(vs Qwen1.5)”- GQA(分组查询注意力)——减少 KV cache,提升吞吐量
- DCA + YARN——上下文扩展到 131,072 tokens
- QKV 偏置保留
- SwiGLU、RoPE、RMSNorm 继承
- SFT: 500K+ 样本,覆盖指令遵循、编码、数学、逻辑、角色扮演、多语言、安全
- RLHF: 离线 DPO → 在线 DPO(模型采样多回复,奖励模型挑选最优/最差)
- 在线合并优化器缓解对齐税
- 自动数据合成:拒绝采样(数学)、执行反馈(编码)、数据重利用(文学)
Qwen2-72B 基座模型
Section titled “Qwen2-72B 基座模型”| Benchmark | Qwen2-72B | Qwen1.5-72B | Llama-3-70B |
|---|---|---|---|
| MMLU | 84.2 | 72.6 | 79.5 |
| GPQA | 37.9 | – | 36.3 |
| HumanEval | 64.6 | 46.3 | – |
| GSM8K | 89.5 | 79.5 | – |
| BBH | 82.4 | 72.6 | – |
| MATH | – | 30.0 (1.5→+17.0) | – |
Qwen2-72B-Instruct
Section titled “Qwen2-72B-Instruct”| Benchmark | 得分 |
|---|---|
| MT-Bench | 9.1 |
| Arena-Hard | 48.1 |
| LiveCodeBench | 35.7 |
MoE 性能
Section titled “MoE 性能”- Qwen2-57B-A14B 在大多数基准上匹配或超越 Qwen2-7B(但激活参数更少)
- 验证了 fine-grained MoE + upcycling 路线的有效性
vs Qwen1.5(密集为主),Qwen2 同时发布密集和 MoE 旗舰。vs Llama-3-70B(Meta,密集),Qwen2-72B 在 MMLU 上领先 4.7 分。vs DeepSeek-V2(MoE),Qwen2 的 fine-grained 专家设计更精细。核心创新:DCA + YARN 实现了 131K 上下文,GQA 显著降低了推理成本。
可复用的工程经验
Section titled “可复用的工程经验”- GQA 是 LLM 推理优化的「免费午餐」——几乎不损失质量的情况下大幅减少 KV cache
- DCA + YARN 是上下文扩展的有效组合——无需长上下文预训练即可实现 4× 扩展
- Fine-grained experts(细粒度专家)比粗粒度专家产生更丰富的组合能力
- Upcycling(从密集升级到 MoE)比从头训练 MoE 节省大量计算
- 在线 DPO 比离线 DPO 更有效——模型在迭代中自我改进