跳转到内容

Mixtral 8x7B — 稀疏 MoE 语言模型的开源先锋

发布日期: 2023-12-11(发布),2024-01-08(论文)
来源: arXiv 2401.04088
工程范式: MoE 开源标杆——46.7B 总参/12.9B 激活,超越 Llama 2 70B。

Mixtral 8x7B 是 Mistral AI 的 MoE 模型,也是首个在各个基准上全面超越 Llama 2 70B 的开源 MoE 模型。

核心理念:MoE 可以在保持推理效率的同时,大幅增加模型容量。46.7B 总参数但推理时只激活 12.9B,每 token 选 2/8 专家。

关键洞察:在相同推理成本(活跃参数约 13B)下,MoE 的性能远超同参数量 dense 模型。

  • 8 个专家(FFN 层替换为标准 FFN × 8)
  • Router(门控网络) 每层选择 top-2 专家
  • 12.9B 活跃参数 / 46.7B 总参数
  • 专家输出加权求和(权重由 router 决定)
  • Decoder-only Transformer
  • GQA(Grouped-Query Attention)
  • SWA(Sliding Window Attention,窗口 4096)
  • RoPE
  • 32K 上下文(训练),可外推
  • 每层 FFN 从 1 个变为 8 个
  • 其他完全一致(注意力、嵌入、层数等)
  • 推理 FLOPs 与 12.9B dense 模型相似
  • 但性能远超任何 13B dense 模型
  • 支持大 batch 推理
模型MMLUGSM8KMATHHumanEvalMBPP
Llama 2 70B68.963.913.529.947.0
GPT-3.570.078.1-48.1-
Mixtral 8x7B70.674.428.440.260.7
  • 在数学和代码基准上大幅超越 Llama 2 70B
  • MMLU 上也略超 Llama 2 70B
  • 接近 GPT-3.5 水平

在法语、德语、西班牙语、意大利语上表现优异(受益于 Mistral 7B 的多语言训练)。

维度Mistral 7BMixtral 8x7BLlama 2 70B
架构DenseMoE (8x)Dense
活跃参数7B12.9B70B
总参数7B46.7B70B
推理成本~2× (vs 7B)10× (vs 7B)
性能超越 13B超越 70B基线
  1. MoE 的”8× 专家、2× 活跃”模式被证明是效率-效果的甜蜜点。
  2. MoE 架构与 SWA/GQA 兼容——Mixtral 在保持 SWA 和 GQA 的同时添加了 MoE 路由。
  3. MoE 在数学和代码任务上的提升最大——这些任务受益于专家专业化。
  4. 开源 MoE 的 Apache 2.0 许可证极大推动社区采用。
  5. MoE 的推理效率优势——用 2× 计算成本获得 5-10× 参数量模型的效果。