跳转到内容

Gemini 1.5 — 百万级上下文与极致计算效率

发布日期: 2024-02-15
来源: arXiv 2403.05530
工程范式: Agentic 能力密度路线——将多模态理解扩展到百万 tokens 级别的上下文窗口,同时提升计算效率。

Gemini 1.5 在 Gemini 1.0 的基础上实现了两大突破:百万级上下文窗口计算效率的飞跃。核心目标是让模型能”记住并推理”极长的多模态上下文——包括整本书、数小时的视频、或上百小时的音频。

Flash 变体的引入是重要的产品决策:通过蒸馏从 Pro 创建更快的轻量版本,在最小质量损失下大幅提升推理速度和降低计算成本。

  • 架构: Gemini 1.5 Pro 使用 Sparse MoE Transformer;1.5 Flash 使用 Dense Transformer(从 Pro 蒸馏)
  • 上下文窗口: 高达 10M tokens(稳定表现至 10M;文本检索 >99.2% 至 10M)
    • 文本:最高 10M tokens
    • 音频:最高 107 小时
    • 视频:最高 10.5 小时(1 fps)
  • 训练: 多模态(文本、代码、图像、音频、视频),使用 TPUv4 pods
  • 蒸馏: Flash 通过在线蒸馏从 Pro 训练而来
  • 关键命名: 同一篇文章中其实介绍了两个模型——初始版 1.5 Pro(二月)和更新版 1.5 Pro(性能大幅提升)+ 1.5 Flash

长上下文检索(Needle-in-Haystack)

Section titled “长上下文检索(Needle-in-Haystack)”
模态Gemini 1.5 Pro (10M)Gemini 1.5 Flash (2M)竞品
文本 (1M)>99.7%100%GPT-4 Turbo 128K
文本 (10M)99.2%--
视频 (10.5h)100%>99.8%GPT-4V ~3分钟
音频 (107h)100%98.7%Whisper+GPT-4 94.5%
基准Gemini 1.5 ProGemini 1.0 Ultra变化
MATH+14.5%基线↑↑
AMC+13.2%基线↑↑
GPQA+5.8%基线
HumanEval84.1%74.4%↑↑
MGSM(多语言数学)82.6%79.0%
Function Calling (BFCL)88.4%67.8%↑↑
任务类别1.5 Pro 用时节省1.0 Pro 用时节省
10 个工作类别56.4%27.7%
有用性评分4.0/52.7/5

Kalamang 语言翻译(长上下文 ICL)

Section titled “Kalamang 语言翻译(长上下文 ICL)”

从完整的 250K token 语法手册中学习 Kalamang 语(全球不到 200 人使用的语言):

方向Gemini 1.5 Pro人类学习者
Kalamang→英语4.14/65.52/6
英语→Kalamang5.46/65.58/6
维度Gemini 1.5 ProGPT-4 TurboClaude 3 Opus
上下文10M tokens128K200K
架构Sparse MoE未公开(Dense/MoE)Dense
检索 (1M)>99.7%< 50% (128K)有限
视频理解SOTa无长视频基准
学习新语言人类可比远低于人类远低于人类
  1. 百万级上下文不是噱头 —— 1.5 Pro 在真实任务(整本书 QA、长视频分析、完整语法学习)上展示了不可替代的价值
  2. 从长上下文中学”新技能”(Kalamang)是比检索更难也更有价值的基准 —— 代表模型从大量信息中提取模式的能力
  3. 蒸馏(Flash from Pro)是扩展模型经济性最高效的方法 —— Flash 用极小的质量代价换来了推理速度的大幅提升
  4. Sparse MoE 是百万级上下文的必要架构选择 —— dense 模型的显存和计算开销在 10M tokens 时无法承受
  5. 长上下文的胜利也是基础设施的胜利 —— TPUv4 pods、高效分布式训练、高质量数据管线共同支撑了 10M 上下文