Llama 3 — 8B 和 70B 开源模型的性能突破
Llama 3
Section titled “Llama 3”发布日期: 2024-04-18(8B & 70B)
来源: arXiv 2407.21783 (The Llama 3 Herd of Models), ai.meta.com/blog
工程范式: 数据质量驱动的性能飞跃——架构不变、数据为王。
Llama 3 的核心洞察简单而有力:架构不需要大改,数据质量和多样性才是性能差异的根本来源。
报告明确写道:Llama 3 的架构相比 Llama 2 “does not deviate significantly”——性能提升主要来自数据质量改进和训练规模扩大。
关键架构决策
Section titled “关键架构决策”| 版本 | 参数 | 训练 tokens | 上下文 |
|---|---|---|---|
| Llama 3 8B | 8B | 15T+ | 8K |
| Llama 3 70B | 70B | 15T+ | 8K |
| Llama 3 405B | 405B | 15T+ | 128K |
注:8B 和 70B 于 2024-04-18 发布,405B 随 Llama 3.1 于 2024-07-31 发布。
- 与 LLaMA 1/2 架构高度一致:Decoder-only Transformer
- Pre-RMSNorm、SwiGLU、RoPE、GQA
- 主要变化:更大的词汇表(128K tokens),更高的训练 tokens(15T+)
- 对 8B 和 70B 使用 GQA(Grouped-Query Attention)
- 对 8B 分别使用不同的 KV 头比例优化推理效率
- 15T+ tokens(相比 Llama 2 的 2T,增加了 7.5 倍)
- 代码数据占比显著增加
- 多语言数据覆盖
- 质量筛选:基于 Lloyd 等模型的分类器
训练基础设施(405B)
Section titled “训练基础设施(405B)”- 使用 FSDP(Fully Sharded Data Parallelism)在 16K H100 GPU 上训练
- 训练 405B 的集群是 Meta 自建的
- 官方发布 FP8 量化版本(Meta FP8 格式)
- 支持在单个 H100 节点运行 70B 模型推理
| 基准 | Llama 3 8B | Llama 3 70B | Llama 2 70B | GPT-3.5 |
|---|---|---|---|---|
| MMLU | 66.6 | 79.5 | 68.9 | 70.0 |
| HellaSwag | 82.0 | 85.5 | 80.7 | 85.5 |
| GSM8K | 63.1 | 86.3 | 63.9 | 78.1 |
| HumanEval | 62.2 | 81.7 | 29.9 | 48.1 |
- Llama 3 70B 在几乎所有基准上超越 GPT-3.5
- Llama 3 8B 在部分基准上超越 Llama 2 70B
- 开源 Llama 3 8B 和 70B 成为社区基准
- 8B 模型在手机端运行成为可能
- 针对 Llama 3 的微调和适配迅速涌现
| 维度 | LLaMA 1 | Llama 2 | Llama 3 |
|---|---|---|---|
| 最大参数 | 65B | 70B | 405B |
| 训练 tokens | 1.0-1.4T | 2T | 15T+ |
| 词汇表 | 32K | 32K | 128K |
| 主要改进 | 架构基础 | 对话对齐 | 数据质量 |
| 多模态 | ❌ | ❌ | ❌(3.1 增加) |
可复用的工程经验
Section titled “可复用的工程经验”- “数据质量” > “架构创新”——Llama 3 证明在架构成熟后,数据成为最大杠杆。
- 15T+ tokens 的训练规模成为新一代标配——从 2T 到 15T 是一个质的飞跃。
- 128K 词汇表提高了 token 效率,减少序列长度。
- FSDP 是训练超大规模模型的实际选择——Meta 在 16K GPU 上成功使用 FSDP 训练 405B。
- 发布 FP8 量化版本降低了社区使用门槛。