跳转到内容

Mistral 7B — 高效 7B 模型,超越 Llama 2 13B

发布日期: 2023-09-27
来源: arXiv 2310.06825
工程范式: 小模型性能密度革命——7B 超越 13B,接近 34B。

Mistral 7B 是 Mistral AI 的首个模型,也是 7B 级别最具冲击力的模型之一。核心理念:在相同的推理成本下,让模型性能尽可能高

Mistral 7B 的核心成就是:超越 Llama 2 13B(所有基准)、超越 Llama 1 34B(推理、数学、代码)。其性能密度(performance per parameter)是当时的标杆。

工程哲学:不堆参数量,靠架构创新和数据质量

标准 Decoder-only Transformer + 两项关键注意力改进:

1. Grouped-Query Attention (GQA)

  • 32 个 query head,8 个 KV head(4:1 分组)
  • 加速推理、减少解码内存
  • 支持更高 batch size

2. Sliding Window Attention (SWA)

  • 每个 token 最多关注前 W=4096 个 token
  • 32 层下有效感受野约 131K tokens(~32 × 4096)
  • 推理成本与窗口大小成线性关系,而非序列长度

3. Rolling Buffer Cache

  • 固定大小的 KV 缓存(窗口大小 W)
  • 缓存满后覆盖旧值
  • 32K 序列缓存减少 8 倍内存(无质量损失)

4. 预填充与分块

  • 长 prompt 按窗口大小分块预填充
  • 在缓存和分块之间计算注意力
参数
dim4096
n_layers32
head_dim128
hidden_dim14336
n_heads32
n_kv_heads8
window_size4096
context_len8192
vocab_size32000
  • Mistral 7B-Instruct:在公开指令数据集上微调(无专有数据)
  • MT-Bench:6.84 ± 0.07(vs Llama 2 13B Chat 的 6.65)
  • 系统 prompt 可实现 100% 拒绝不安全 prompt(175 个测试 prompt)
  • 自反式内容审核:精度 99.4%,召回 95.6%
模型MMLUHellaSwagWinoGrandeHumanEvalGSM8KMATH
Llama 2 7B44.477.169.511.616.03.9
Llama 2 13B55.680.772.918.934.36.0
Mistral 7B60.181.375.330.552.213.1
Llama 1 34B---22.044.07.6
  • Mistral 7B 在 MMLU 上达到类似 Llama 2 3 倍参数量的性能
  • 在 HumanEval 上接近 Code-Llama 7B(30.5 vs 31.1),同时保留非代码能力
  • llmboxing.com 上 Mistral 7B-Instruct 的输出被偏好 5020 次 vs Llama 2 13B Chat 的 4143 次
维度Mistral 7BLlama 2 13BLlama 1 34B
参数7B13B34B
SWA
GQA
Apache 2.0
性能密度最高
  1. SWA + GQA 的组合是 7B 模型超越 13B 的架构基础。
  2. 性能密度(performance per parameter)是比绝对性能更重要的指标——对于生产部署至关重要。
  3. Rolling Buffer Cache 是 SWA 工程实现的精妙设计,大幅降低长序列推理内存。
  4. 自反式内容审核(模型自己判断输出安全性)是一个实用的安全方案。
  5. Apache 2.0 许可的商业友好性对社区采用至关重要。