Llama 2 — 开源基础模型与对话模型
Llama 2
Section titled “Llama 2”发布日期: 2023-07-18
来源: arXiv 2307.09288
工程范式: 开源对话模型的全面对齐——从基础模型到可用聊天系统的完整工程化。
Llama 2 是 LLaMA 的继任者,核心变化是:
- 参数量提升:增加到 70B(从 65B)
- 对话优化:正式发布 Llama 2-Chat 聊天模型
- 安全对齐:首次将安全作为核心工程模块
- 人机协作:引入人类偏好数据 + RLHF
核心理念:开源模型不仅要强,还要安全可用。报告详细描述了从预训练到 SFT 到 RLHF 到安全微调的完整流程,成为后续开源模型的工程模板。
关键架构决策
Section titled “关键架构决策”- 模型规模:7B、13B、70B
- 训练 tokens:2T(相比 LLaMA 的 1.0-1.4T 翻倍)
- 上下文长度:4,096 tokens
- 架构:与 LLaMA 1 保持一致的 Decoder-only Transformer
- Pre-RMSNorm、SwiGLU、RoPE
- 数据:公开数据 + 额外筛选的高质量数据
- 训练优化:2T tokens 在自托管集群上
后训练:SFT + RLHF
Section titled “后训练:SFT + RLHF”- SFT:监督微调,使用高质量标注数据
- RLHF:两阶段
- 奖励模型训练
- PPO 策略优化
- 关键创新:人类偏好数据 + 大规模标注
- 收集了大量比较数据(helpfulness 和 safety 两个维度)
Ghost Attention (GAtt)
Section titled “Ghost Attention (GAtt)”- 一种新的训练技巧,在 RLHF 中防止系统提示被忽略
- 帮助模型在长对话中保持一致的指令遵循
- 安全奖励模型:独立于帮助性奖励模型
- 安全 SFT:专门的安全对话数据
- 拒绝采样:在安全边界明确拒绝
- 安全评估包含红队测试
帮助性评估(人工)
Section titled “帮助性评估(人工)”Llama 2-Chat 在帮助性上超越所有开源聊天模型,在某些基准上接近 ChatGPT。
- 安全分类器:对不安全 prompt 的拒绝率达到 90%+
- 红队测试:经过专业红队的安全评估
- 相比 LLaMA 1,攻击成功率显著下降
| 模型 | MMLU | GSM8K | HumanEval |
|---|---|---|---|
| Llama 2 7B | 45.3 | 14.6 | 12.8 |
| Llama 2 13B | 54.8 | 28.7 | 18.3 |
| Llama 2 70B | 68.9 | 63.9 | 29.9 |
| 维度 | LLaMA 1 | Llama 2 | GPT-3.5 |
|---|---|---|---|
| 参数量 | 7B-65B | 7B-70B | 175B |
| 训练 tokens | 1.0-1.4T | 2T | ~ |
| 对话模型 | ❌ 无 | ✅ Llama 2-Chat | ✅ |
| RLHF | ❌ | ✅ | ✅ |
| 安全报告 | ❌ | ✅ 详细 | 部分 |
| Ghost Attention | ❌ | ✅ | 类似机制 |
可复用的工程经验
Section titled “可复用的工程经验”- RLHF 的开源实现模板——Llama 2 的 SFT + 奖励模型 + PPO 流程成为后续几乎所有开源对话模型的标准。
- 安全对齐和帮助性对齐是两套系统——需要独立的奖励模型和训练数据。
- Ghost Attention 是系统提示保持的实用技巧——解决了 RLHF 中长对话的一致性问题。
- 人类偏好数据的规模和质量比算法更重要——Llama 2 的标注数据量是其成功的关键。
- 安全需要贯穿全流程——从预训练数据筛选到 SFT 到 RLHF 到安全微调,每个阶段都要考虑。