Mixtral 8x7B — 稀疏 MoE 语言模型的开源先锋
Mixtral 8x7B
Section titled “Mixtral 8x7B”发布日期: 2023-12-11(发布),2024-01-08(论文)
来源: arXiv 2401.04088
工程范式: MoE 开源标杆——46.7B 总参/12.9B 激活,超越 Llama 2 70B。
Mixtral 8x7B 是 Mistral AI 的 MoE 模型,也是首个在各个基准上全面超越 Llama 2 70B 的开源 MoE 模型。
核心理念:MoE 可以在保持推理效率的同时,大幅增加模型容量。46.7B 总参数但推理时只激活 12.9B,每 token 选 2/8 专家。
关键洞察:在相同推理成本(活跃参数约 13B)下,MoE 的性能远超同参数量 dense 模型。
关键架构决策
Section titled “关键架构决策”MoE 架构
Section titled “MoE 架构”- 8 个专家(FFN 层替换为标准 FFN × 8)
- Router(门控网络) 每层选择 top-2 专家
- 12.9B 活跃参数 / 46.7B 总参数
- 专家输出加权求和(权重由 router 决定)
基座架构(同 Mistral 7B)
Section titled “基座架构(同 Mistral 7B)”- Decoder-only Transformer
- GQA(Grouped-Query Attention)
- SWA(Sliding Window Attention,窗口 4096)
- RoPE
- 32K 上下文(训练),可外推
与 Mistral 7B 的区别
Section titled “与 Mistral 7B 的区别”- 每层 FFN 从 1 个变为 8 个
- 其他完全一致(注意力、嵌入、层数等)
- 推理 FLOPs 与 12.9B dense 模型相似
- 但性能远超任何 13B dense 模型
- 支持大 batch 推理
| 模型 | MMLU | GSM8K | MATH | HumanEval | MBPP |
|---|---|---|---|---|---|
| Llama 2 70B | 68.9 | 63.9 | 13.5 | 29.9 | 47.0 |
| GPT-3.5 | 70.0 | 78.1 | - | 48.1 | - |
| Mixtral 8x7B | 70.6 | 74.4 | 28.4 | 40.2 | 60.7 |
- 在数学和代码基准上大幅超越 Llama 2 70B
- MMLU 上也略超 Llama 2 70B
- 接近 GPT-3.5 水平
在法语、德语、西班牙语、意大利语上表现优异(受益于 Mistral 7B 的多语言训练)。
| 维度 | Mistral 7B | Mixtral 8x7B | Llama 2 70B |
|---|---|---|---|
| 架构 | Dense | MoE (8x) | Dense |
| 活跃参数 | 7B | 12.9B | 70B |
| 总参数 | 7B | 46.7B | 70B |
| 推理成本 | 1× | ~2× (vs 7B) | 10× (vs 7B) |
| 性能 | 超越 13B | 超越 70B | 基线 |
可复用的工程经验
Section titled “可复用的工程经验”- MoE 的”8× 专家、2× 活跃”模式被证明是效率-效果的甜蜜点。
- MoE 架构与 SWA/GQA 兼容——Mixtral 在保持 SWA 和 GQA 的同时添加了 MoE 路由。
- MoE 在数学和代码任务上的提升最大——这些任务受益于专家专业化。
- 开源 MoE 的 Apache 2.0 许可证极大推动社区采用。
- MoE 的推理效率优势——用 2× 计算成本获得 5-10× 参数量模型的效果。