Llama 3.1 — 首个开源 GPT-4 级别模型
Llama 3.1
Section titled “Llama 3.1”发布日期: 2024-07-31
来源: arXiv 2407.21783 (The Llama 3 Herd of Models)
工程范式: 开源模型首次追上闭源旗舰——405B 模型达到 GPT-4 级别。
Llama 3.1(同 Llama 3 完整报告,arxiv 发布版本包含 3.1 数据)是 Meta AI 的里程碑——首次有开源模型在综合能力上达到 GPT-4 级别。
报告标题 “The Llama 3 Herd of Models” 覆盖了整个 Llama 3 家族(8B、70B、405B),但 405B 是 Llama 3.1 的正式名称。核心哲学:
- 开源模型可以追上闭源——405B 在大多数基准上与 GPT-4 竞争
- 大规模训练 + 高质量数据 + 先进后训练 = 前沿性能
- 多模态探索——通过组合方法集成图像、视频、语音
“Llama 3 delivers comparable quality to leading language models such as GPT-4 on a plethora of tasks.”
关键架构决策
Section titled “关键架构决策”405B 模型规格
Section titled “405B 模型规格”| 属性 | 值 |
|---|---|
| 参数 | 405B |
| 架构 | Decoder-only Transformer(Dense,非 MoE) |
| 层数 | 126 |
| 隐藏维度 | 16,384 |
| 注意力头 | 128 |
| KV 头 | 8 (GQA) |
| 词汇表 | 128K |
| 训练 tokens | 15T+ |
| 上下文 | 128K |
| 训练硬件 | 16K H100 GPU |
| 训练框架 | FSDP |
后训练(Post-Training)
Section titled “后训练(Post-Training)”Llama 3.1 的后训练框架极为详尽,包括:
- SFT:监督微调
- 奖励模型:用于对齐
- RLHF:直接偏好优化
- 拒绝采样 + DPO
- 工具使用:搜索工具 + 编码工具
- 多语言:8 种语言的指令数据
- 通过组合方法(非端到端训练)集成图像、视频、语音能力
- 使用预训练的视觉编码器 + 音频编码器 + Llama 3 语言模型
- 保持语言模型权重不变,只训练适配器
Llama Guard 3
Section titled “Llama Guard 3”- 专门的安全分类模型(8B 参数)
- 基于 Llama 3.1-8B 微调
- 输入和输出的内容安全分类
学术基准(405B vs GPT-4)
Section titled “学术基准(405B vs GPT-4)”| 基准 | Llama 3.1 405B | GPT-4 (0314) | GPT-4 Turbo |
|---|---|---|---|
| MMLU | 87.3 | 86.4 | 86.7 |
| GSM8K | 96.8 | 92.0 | 95.6 |
| MATH | 73.8 | 52.9 | 73.4 |
| HumanEval | 89.0 | 67.0 | 88.2 |
| MBPP | 88.6 | - | - |
| IFEval | 87.9 | - | 88.7 |
- Llama 3.1 405B 在 MMLU、GSM8K、MATH、HumanEval 上超越 GPT-4
- 在所有基准上接近或超越 GPT-4 Turbo
| 维度 | Llama 2 70B | Llama 3.1 405B | GPT-4 |
|---|---|---|---|
| 参数 | 70B | 405B | ~1.7T |
| 上下文 | 4K | 128K | 32K/128K |
| 训练 tokens | 2T | 15T+ | - |
| 多模态 | ❌ | 组合方法 | 原生 |
| 开源 | ✅ | ✅ | ❌ |
| GPT-4 级别性能 | ❌ | ✅ | ✅ |
可复用的工程经验
Section titled “可复用的工程经验”- Dense 405B 可以追上 GPT-4——证明 dense 架构在 400B+ 规模仍有提升空间,不一定要用 MoE。
- 组合多模态(非端到端)是快速实现多模态能力的务实路径。
- Llama Guard 3 的开源——安全分类器与模型共同发布,降低了部署安全风险。
- 后训练的工程细节——SFT + 奖励模型 + RLHF + DPO 的多阶段流程成为 400B+ 级别模型的标配。
- 128K 上下文在 dense 405B 上的实现——证明长上下文能力不需要 MoE。
- 16K H100 GPU 集群的训练基础设施规模已经是顶尖水平。