跳转到内容

Qwen2 — 密集 + MoE 双旗舰

发布日期: 2024-07 (arXiv 2407.10671) 来源: arXiv 2407.10671 工程范式: 密集 + MoE 双轨并行——57B 总参/14B 激活的 MoE 与 72B 密集旗舰互补,覆盖不同部署场景。

Qwen2 的核心战略是双轨并行——同时发布密集(0.5B~72B)和 MoE(57B-A14B)两种架构的旗舰模型,让开发者根据部署约束选择。关键架构升级包括:GQA(分组查询注意力)、DCA + YARN(127K 超长上下文)、Fine-grained MoE 专家设计。

尺寸隐藏层层数Q 头KV 头训练 tokens
0.5B8962414212T
1.5B1,536281227T
7B3,584282847T
72B8,192806487T
  • 总参: 57B,激活参数: 14B
  • Fine-grained experts:64 个路由专家 + 8 个共享专家,8 个激活
  • 专家初始化:从密集模型 upcycling,参数 shuffle + 50% 随机重新初始化
  • 额外训练 4.5T tokens(在 7T 预训练基础上)
  • GQA(分组查询注意力)——减少 KV cache,提升吞吐量
  • DCA + YARN——上下文扩展到 131,072 tokens
  • QKV 偏置保留
  • SwiGLU、RoPE、RMSNorm 继承
  • SFT: 500K+ 样本,覆盖指令遵循、编码、数学、逻辑、角色扮演、多语言、安全
  • RLHF: 离线 DPO → 在线 DPO(模型采样多回复,奖励模型挑选最优/最差)
  • 在线合并优化器缓解对齐税
  • 自动数据合成:拒绝采样(数学)、执行反馈(编码)、数据重利用(文学)
BenchmarkQwen2-72BQwen1.5-72BLlama-3-70B
MMLU84.272.679.5
GPQA37.936.3
HumanEval64.646.3
GSM8K89.579.5
BBH82.472.6
MATH30.0 (1.5→+17.0)
Benchmark得分
MT-Bench9.1
Arena-Hard48.1
LiveCodeBench35.7
  • Qwen2-57B-A14B 在大多数基准上匹配或超越 Qwen2-7B(但激活参数更少)
  • 验证了 fine-grained MoE + upcycling 路线的有效性

vs Qwen1.5(密集为主),Qwen2 同时发布密集和 MoE 旗舰。vs Llama-3-70B(Meta,密集),Qwen2-72B 在 MMLU 上领先 4.7 分。vs DeepSeek-V2(MoE),Qwen2 的 fine-grained 专家设计更精细。核心创新:DCA + YARN 实现了 131K 上下文,GQA 显著降低了推理成本。

  1. GQA 是 LLM 推理优化的「免费午餐」——几乎不损失质量的情况下大幅减少 KV cache
  2. DCA + YARN 是上下文扩展的有效组合——无需长上下文预训练即可实现 4× 扩展
  3. Fine-grained experts(细粒度专家)比粗粒度专家产生更丰富的组合能力
  4. Upcycling(从密集升级到 MoE)比从头训练 MoE 节省大量计算
  5. 在线 DPO 比离线 DPO 更有效——模型在迭代中自我改进