跳转到内容

Llama 2 — 开源基础模型与对话模型

发布日期: 2023-07-18
来源: arXiv 2307.09288
工程范式: 开源对话模型的全面对齐——从基础模型到可用聊天系统的完整工程化。

Llama 2 是 LLaMA 的继任者,核心变化是:

  1. 参数量提升:增加到 70B(从 65B)
  2. 对话优化:正式发布 Llama 2-Chat 聊天模型
  3. 安全对齐:首次将安全作为核心工程模块
  4. 人机协作:引入人类偏好数据 + RLHF

核心理念:开源模型不仅要强,还要安全可用。报告详细描述了从预训练到 SFT 到 RLHF 到安全微调的完整流程,成为后续开源模型的工程模板。

  • 模型规模:7B、13B、70B
  • 训练 tokens:2T(相比 LLaMA 的 1.0-1.4T 翻倍)
  • 上下文长度:4,096 tokens
  • 架构:与 LLaMA 1 保持一致的 Decoder-only Transformer
    • Pre-RMSNorm、SwiGLU、RoPE
  • 数据:公开数据 + 额外筛选的高质量数据
  • 训练优化:2T tokens 在自托管集群上
  • SFT:监督微调,使用高质量标注数据
  • RLHF:两阶段
    • 奖励模型训练
    • PPO 策略优化
  • 关键创新:人类偏好数据 + 大规模标注
    • 收集了大量比较数据(helpfulness 和 safety 两个维度)
  • 一种新的训练技巧,在 RLHF 中防止系统提示被忽略
  • 帮助模型在长对话中保持一致的指令遵循
  • 安全奖励模型:独立于帮助性奖励模型
  • 安全 SFT:专门的安全对话数据
  • 拒绝采样:在安全边界明确拒绝
  • 安全评估包含红队测试

Llama 2-Chat 在帮助性上超越所有开源聊天模型,在某些基准上接近 ChatGPT。

  • 安全分类器:对不安全 prompt 的拒绝率达到 90%+
  • 红队测试:经过专业红队的安全评估
  • 相比 LLaMA 1,攻击成功率显著下降
模型MMLUGSM8KHumanEval
Llama 2 7B45.314.612.8
Llama 2 13B54.828.718.3
Llama 2 70B68.963.929.9
维度LLaMA 1Llama 2GPT-3.5
参数量7B-65B7B-70B175B
训练 tokens1.0-1.4T2T~
对话模型❌ 无✅ Llama 2-Chat
RLHF
安全报告✅ 详细部分
Ghost Attention类似机制
  1. RLHF 的开源实现模板——Llama 2 的 SFT + 奖励模型 + PPO 流程成为后续几乎所有开源对话模型的标准。
  2. 安全对齐和帮助性对齐是两套系统——需要独立的奖励模型和训练数据。
  3. Ghost Attention 是系统提示保持的实用技巧——解决了 RLHF 中长对话的一致性问题。
  4. 人类偏好数据的规模和质量比算法更重要——Llama 2 的标注数据量是其成功的关键。
  5. 安全需要贯穿全流程——从预训练数据筛选到 SFT 到 RLHF 到安全微调,每个阶段都要考虑。