跳转到内容

Gemma — 开源模型的新标准

发布日期: 2024-02-21
来源: arXiv 2403.08295
工程范式: Agentic 能力密度路线——将 Gemini 研究成果转化为面向开发者的轻量开源模型。

Gemma 是 Google DeepMind 基于 Gemini 研究成果打造的 轻量开源模型家族。核心哲学是将前沿模型(Gemini)的架构创新、训练技术、数据处理经验浓缩到适合社区使用的小模型中。

两个规模(2B/7B)满足不同场景:2B 面向 CPU 和设备端,7B 面向 GPU 和 TPU 部署。每个规模都提供预训练和指令微调版本。

关键信号:Google 终于在开源 LLM 领域有了真正有竞争力的产品。

属性Gemma 2BGemma 7B
d_model20483072
层数1828
FFW 隐藏维度3276849152
注意力头数8 (MQA, KV=1)16 (MHA)
头维度256256
词表256128256128
预训练 tokens3T6T
上下文81928192
训练硬件512 TPUv5e4096 TPUv5e
碳排放~131 tCO₂~131 tCO₂
  • 核心: Transformer decoder
  • 注意力: 7B 使用 Multi-Head Attention;2B 使用 Multi-Query Attention(单 KV 头)
  • 位置编码: Rotary Positional Embeddings (RoPE)
  • 激活函数: GeGLU
  • 归一化: RMSNorm(每子层)
  • Embedding 共享: 输入和输出 embedding 共享
  • 分词器: SentencePiece,256K 词表(继承自 Gemini)
  • 阶段 1: SFT(监督微调)—— 合成+人工混合的 prompt-response 对
  • 阶段 2: RLHF(基于人类反馈的强化学习)—— Bradley-Terry reward model + 新型 RL 算法
基准Gemma 7BMistral 7BLLaMA2 13B
MMLU64.6%64.2%54.8%
ARC-c61.9%60.0%59.4%
HellaSwag82.2%83.3%81.9%
GSM8K50.9%37.8%36.7%
平均63.8%61.0%-

人类偏好(vs Mistral 7B v0.2 Instruct)

Section titled “人类偏好(vs Mistral 7B v0.2 Instruct)”
维度Gemma 7B ITGemma 2B IT
安全胜率63.5%60.1%
指令遵循胜率61.2%45%
  • 精确记忆率:非常低(7B 约 10⁻⁶),与 PaLM 2 相当
  • 未检测到记忆敏感个人信息(SSN、邮箱等)
维度Gemma 7BGemma 2BMistral 7BLLaMA2 7B
架构Dense TransformerMQA TransformerDenseDense
词表256K256K32K32K
预训练 tokens6T3T-2T
碳排放131 tCO₂---
安全评估详细(+RLHF)详细有限有限
源自 Gemini
  1. 前沿模型的研究成果可以系统性地转移到小模型 —— Gemma 的架构、分词器、训练配方都受益于 Gemini
  2. 256K 词表对小模型也有显著提升 —— 尤其是多语言场景
  3. 安全评估的透明度和细节是开源模型的新标准 —— 详细的安全测试、记忆化分析、RLHF 安全胜率报告
  4. 在 2B 规模使用 MQA 是关键效率决策 —— 单 KV 头在小模型上可以大幅减少 KV cache
  5. 碳足迹披露(131 tCO₂)是负责任发布的良好实践