跳转到内容

Llama 3.1 — 首个开源 GPT-4 级别模型

发布日期: 2024-07-31
来源: arXiv 2407.21783 (The Llama 3 Herd of Models)
工程范式: 开源模型首次追上闭源旗舰——405B 模型达到 GPT-4 级别。

Llama 3.1(同 Llama 3 完整报告,arxiv 发布版本包含 3.1 数据)是 Meta AI 的里程碑——首次有开源模型在综合能力上达到 GPT-4 级别

报告标题 “The Llama 3 Herd of Models” 覆盖了整个 Llama 3 家族(8B、70B、405B),但 405B 是 Llama 3.1 的正式名称。核心哲学:

  1. 开源模型可以追上闭源——405B 在大多数基准上与 GPT-4 竞争
  2. 大规模训练 + 高质量数据 + 先进后训练 = 前沿性能
  3. 多模态探索——通过组合方法集成图像、视频、语音

“Llama 3 delivers comparable quality to leading language models such as GPT-4 on a plethora of tasks.”

属性
参数405B
架构Decoder-only Transformer(Dense,非 MoE)
层数126
隐藏维度16,384
注意力头128
KV 头8 (GQA)
词汇表128K
训练 tokens15T+
上下文128K
训练硬件16K H100 GPU
训练框架FSDP

Llama 3.1 的后训练框架极为详尽,包括:

  1. SFT:监督微调
  2. 奖励模型:用于对齐
  3. RLHF:直接偏好优化
  4. 拒绝采样 + DPO
  5. 工具使用:搜索工具 + 编码工具
  6. 多语言:8 种语言的指令数据
  • 通过组合方法(非端到端训练)集成图像、视频、语音能力
  • 使用预训练的视觉编码器 + 音频编码器 + Llama 3 语言模型
  • 保持语言模型权重不变,只训练适配器
  • 专门的安全分类模型(8B 参数)
  • 基于 Llama 3.1-8B 微调
  • 输入和输出的内容安全分类
基准Llama 3.1 405BGPT-4 (0314)GPT-4 Turbo
MMLU87.386.486.7
GSM8K96.892.095.6
MATH73.852.973.4
HumanEval89.067.088.2
MBPP88.6--
IFEval87.9-88.7
  • Llama 3.1 405B 在 MMLU、GSM8K、MATH、HumanEval 上超越 GPT-4
  • 在所有基准上接近或超越 GPT-4 Turbo
维度Llama 2 70BLlama 3.1 405BGPT-4
参数70B405B~1.7T
上下文4K128K32K/128K
训练 tokens2T15T+-
多模态组合方法原生
开源
GPT-4 级别性能
  1. Dense 405B 可以追上 GPT-4——证明 dense 架构在 400B+ 规模仍有提升空间,不一定要用 MoE。
  2. 组合多模态(非端到端)是快速实现多模态能力的务实路径。
  3. Llama Guard 3 的开源——安全分类器与模型共同发布,降低了部署安全风险。
  4. 后训练的工程细节——SFT + 奖励模型 + RLHF + DPO 的多阶段流程成为 400B+ 级别模型的标配。
  5. 128K 上下文在 dense 405B 上的实现——证明长上下文能力不需要 MoE。
  6. 16K H100 GPU 集群的训练基础设施规模已经是顶尖水平。