跳转到内容

Llama 3 — 8B 和 70B 开源模型的性能突破

发布日期: 2024-04-18(8B & 70B)
来源: arXiv 2407.21783 (The Llama 3 Herd of Models), ai.meta.com/blog
工程范式: 数据质量驱动的性能飞跃——架构不变、数据为王。

Llama 3 的核心洞察简单而有力:架构不需要大改,数据质量和多样性才是性能差异的根本来源

报告明确写道:Llama 3 的架构相比 Llama 2 “does not deviate significantly”——性能提升主要来自数据质量改进和训练规模扩大。

版本参数训练 tokens上下文
Llama 3 8B8B15T+8K
Llama 3 70B70B15T+8K
Llama 3 405B405B15T+128K

注:8B 和 70B 于 2024-04-18 发布,405B 随 Llama 3.1 于 2024-07-31 发布。

  • 与 LLaMA 1/2 架构高度一致:Decoder-only Transformer
  • Pre-RMSNorm、SwiGLU、RoPE、GQA
  • 主要变化:更大的词汇表(128K tokens),更高的训练 tokens(15T+)
  • 对 8B 和 70B 使用 GQA(Grouped-Query Attention)
  • 对 8B 分别使用不同的 KV 头比例优化推理效率
  • 15T+ tokens(相比 Llama 2 的 2T,增加了 7.5 倍)
  • 代码数据占比显著增加
  • 多语言数据覆盖
  • 质量筛选:基于 Lloyd 等模型的分类器
  • 使用 FSDP(Fully Sharded Data Parallelism)在 16K H100 GPU 上训练
  • 训练 405B 的集群是 Meta 自建的
  • 官方发布 FP8 量化版本(Meta FP8 格式)
  • 支持在单个 H100 节点运行 70B 模型推理
基准Llama 3 8BLlama 3 70BLlama 2 70BGPT-3.5
MMLU66.679.568.970.0
HellaSwag82.085.580.785.5
GSM8K63.186.363.978.1
HumanEval62.281.729.948.1
  • Llama 3 70B 在几乎所有基准上超越 GPT-3.5
  • Llama 3 8B 在部分基准上超越 Llama 2 70B
  • 开源 Llama 3 8B 和 70B 成为社区基准
  • 8B 模型在手机端运行成为可能
  • 针对 Llama 3 的微调和适配迅速涌现
维度LLaMA 1Llama 2Llama 3
最大参数65B70B405B
训练 tokens1.0-1.4T2T15T+
词汇表32K32K128K
主要改进架构基础对话对齐数据质量
多模态❌(3.1 增加)
  1. “数据质量” > “架构创新”——Llama 3 证明在架构成熟后,数据成为最大杠杆。
  2. 15T+ tokens 的训练规模成为新一代标配——从 2T 到 15T 是一个质的飞跃。
  3. 128K 词汇表提高了 token 效率,减少序列长度。
  4. FSDP 是训练超大规模模型的实际选择——Meta 在 16K GPU 上成功使用 FSDP 训练 405B。
  5. 发布 FP8 量化版本降低了社区使用门槛。