跳转到内容

Mixtral 8x22B — 超大 MoE 开源模型

发布日期: 2024-04-10
来源: mistral.ai/news/mixtral-8x22b
工程范式: MoE 大规模化——141B 总参/39B 激活的稀疏专家模型。

Mixtral 8x22B 是 Mixtral 8x7B 的放大版本,将专家 FFN 从 7B 放大到 22B 级别。

核心哲学:MoE 规模放大是平滑的——从 8x7B 到 8x22B 不需要改动架构,只需要扩大每个专家的大小。

“Mixtral 8x22B sets a new standard for performance and efficiency within the AI community.”

  • 8 个专家,每 token 选 top-2
  • 39B 活跃参数 / 141B 总参数
  • 架构与 Mixtral 8x7B 一致(GQA + SWA + RoPE)
  • 上下文长度:64K
  • 英语、法语、德语、西班牙语、意大利语
  • 原生函数调用支持
  • 约束输出模式支持
  • Apache 2.0 开源
基准Mixtral 8x22B (39B act)Llama 2 70BCommand R+
MMLU领先68.9落后
HellaSwag领先--
GSM8K领先63.9-
HumanEval领先29.9-
MATH领先13.5-
  • 在所有基准上超越 Llama 2 70B
  • 最佳性能-成本比的开源模型之一
  • 在代码和数学任务上表现最优
维度Mixtral 8x7BMixtral 8x22BLlama 3 70B
活跃参数12.9B39B70B
总参数46.7B141B70B
上下文32K64K8K
多语言4 种5 种英文为主
函数调用有限原生有限
  1. MoE 的低成本边际扩展——从 8x7B 到 8x22B 不需要架构创新,只需放大专家。
  2. 39B 活跃参数 vs 70B dense 的性价比优势——以 ~55% 的活跃参数达到同等或更好性能。
  3. 原生函数调用是 Mistral 的差异化能力——Mixtral 8x22B 即支持函数调用。
  4. Apache 2.0 许可证的一致策略降低了社区选择成本。
  5. 64K 上下文在开源 MoE 上的实现为长文档场景提供了经济的选择。