Gemma — 开源模型的新标准
发布日期: 2024-02-21
来源: arXiv 2403.08295
工程范式: Agentic 能力密度路线——将 Gemini 研究成果转化为面向开发者的轻量开源模型。
Gemma 是 Google DeepMind 基于 Gemini 研究成果打造的 轻量开源模型家族。核心哲学是将前沿模型(Gemini)的架构创新、训练技术、数据处理经验浓缩到适合社区使用的小模型中。
两个规模(2B/7B)满足不同场景:2B 面向 CPU 和设备端,7B 面向 GPU 和 TPU 部署。每个规模都提供预训练和指令微调版本。
关键信号:Google 终于在开源 LLM 领域有了真正有竞争力的产品。
关键架构决策
Section titled “关键架构决策”| 属性 | Gemma 2B | Gemma 7B |
|---|---|---|
| d_model | 2048 | 3072 |
| 层数 | 18 | 28 |
| FFW 隐藏维度 | 32768 | 49152 |
| 注意力头数 | 8 (MQA, KV=1) | 16 (MHA) |
| 头维度 | 256 | 256 |
| 词表 | 256128 | 256128 |
| 预训练 tokens | 3T | 6T |
| 上下文 | 8192 | 8192 |
| 训练硬件 | 512 TPUv5e | 4096 TPUv5e |
| 碳排放 | ~131 tCO₂ | ~131 tCO₂ |
- 核心: Transformer decoder
- 注意力: 7B 使用 Multi-Head Attention;2B 使用 Multi-Query Attention(单 KV 头)
- 位置编码: Rotary Positional Embeddings (RoPE)
- 激活函数: GeGLU
- 归一化: RMSNorm(每子层)
- Embedding 共享: 输入和输出 embedding 共享
- 分词器: SentencePiece,256K 词表(继承自 Gemini)
- 阶段 1: SFT(监督微调)—— 合成+人工混合的 prompt-response 对
- 阶段 2: RLHF(基于人类反馈的强化学习)—— Bradley-Terry reward model + 新型 RL 算法
自动化基准(7B 对比)
Section titled “自动化基准(7B 对比)”| 基准 | Gemma 7B | Mistral 7B | LLaMA2 13B |
|---|---|---|---|
| MMLU | 64.6% | 64.2% | 54.8% |
| ARC-c | 61.9% | 60.0% | 59.4% |
| HellaSwag | 82.2% | 83.3% | 81.9% |
| GSM8K | 50.9% | 37.8% | 36.7% |
| 平均 | 63.8% | 61.0% | - |
人类偏好(vs Mistral 7B v0.2 Instruct)
Section titled “人类偏好(vs Mistral 7B v0.2 Instruct)”| 维度 | Gemma 7B IT | Gemma 2B IT |
|---|---|---|
| 安全胜率 | 63.5% | 60.1% |
| 指令遵循胜率 | 61.2% | 45% |
- 精确记忆率:非常低(7B 约 10⁻⁶),与 PaLM 2 相当
- 未检测到记忆敏感个人信息(SSN、邮箱等)
| 维度 | Gemma 7B | Gemma 2B | Mistral 7B | LLaMA2 7B |
|---|---|---|---|---|
| 架构 | Dense Transformer | MQA Transformer | Dense | Dense |
| 词表 | 256K | 256K | 32K | 32K |
| 预训练 tokens | 6T | 3T | - | 2T |
| 碳排放 | 131 tCO₂ | - | - | - |
| 安全评估 | 详细(+RLHF) | 详细 | 有限 | 有限 |
| 源自 Gemini | ✅ | ✅ | ❌ | ❌ |
可复用的工程经验
Section titled “可复用的工程经验”- 前沿模型的研究成果可以系统性地转移到小模型 —— Gemma 的架构、分词器、训练配方都受益于 Gemini
- 256K 词表对小模型也有显著提升 —— 尤其是多语言场景
- 安全评估的透明度和细节是开源模型的新标准 —— 详细的安全测试、记忆化分析、RLHF 安全胜率报告
- 在 2B 规模使用 MQA 是关键效率决策 —— 单 KV 头在小模型上可以大幅减少 KV cache
- 碳足迹披露(131 tCO₂)是负责任发布的良好实践