发布日期: 2024-02-15
来源: arXiv 2403.05530
工程范式: Agentic 能力密度路线——将多模态理解扩展到百万 tokens 级别的上下文窗口,同时提升计算效率。
Gemini 1.5 在 Gemini 1.0 的基础上实现了两大突破:百万级上下文窗口 和 计算效率的飞跃。核心目标是让模型能”记住并推理”极长的多模态上下文——包括整本书、数小时的视频、或上百小时的音频。
Flash 变体的引入是重要的产品决策:通过蒸馏从 Pro 创建更快的轻量版本,在最小质量损失下大幅提升推理速度和降低计算成本。
- 架构: Gemini 1.5 Pro 使用 Sparse MoE Transformer;1.5 Flash 使用 Dense Transformer(从 Pro 蒸馏)
- 上下文窗口: 高达 10M tokens(稳定表现至 10M;文本检索 >99.2% 至 10M)
- 文本:最高 10M tokens
- 音频:最高 107 小时
- 视频:最高 10.5 小时(1 fps)
- 训练: 多模态(文本、代码、图像、音频、视频),使用 TPUv4 pods
- 蒸馏: Flash 通过在线蒸馏从 Pro 训练而来
- 关键命名: 同一篇文章中其实介绍了两个模型——初始版 1.5 Pro(二月)和更新版 1.5 Pro(性能大幅提升)+ 1.5 Flash
| 模态 | Gemini 1.5 Pro (10M) | Gemini 1.5 Flash (2M) | 竞品 |
|---|
| 文本 (1M) | >99.7% | 100% | GPT-4 Turbo 128K |
| 文本 (10M) | 99.2% | - | - |
| 视频 (10.5h) | 100% | >99.8% | GPT-4V ~3分钟 |
| 音频 (107h) | 100% | 98.7% | Whisper+GPT-4 94.5% |
| 基准 | Gemini 1.5 Pro | Gemini 1.0 Ultra | 变化 |
|---|
| MATH | +14.5% | 基线 | ↑↑ |
| AMC | +13.2% | 基线 | ↑↑ |
| GPQA | +5.8% | 基线 | ↑ |
| HumanEval | 84.1% | 74.4% | ↑↑ |
| MGSM(多语言数学) | 82.6% | 79.0% | ↑ |
| Function Calling (BFCL) | 88.4% | 67.8% | ↑↑ |
| 任务类别 | 1.5 Pro 用时节省 | 1.0 Pro 用时节省 |
|---|
| 10 个工作类别 | 56.4% | 27.7% |
| 有用性评分 | 4.0/5 | 2.7/5 |
从完整的 250K token 语法手册中学习 Kalamang 语(全球不到 200 人使用的语言):
| 方向 | Gemini 1.5 Pro | 人类学习者 |
|---|
| Kalamang→英语 | 4.14/6 | 5.52/6 |
| 英语→Kalamang | 5.46/6 | 5.58/6 |
| 维度 | Gemini 1.5 Pro | GPT-4 Turbo | Claude 3 Opus |
|---|
| 上下文 | 10M tokens | 128K | 200K |
| 架构 | Sparse MoE | 未公开(Dense/MoE) | Dense |
| 检索 (1M) | >99.7% | < 50% (128K) | 有限 |
| 视频理解 | SOTa | 无长视频基准 | 无 |
| 学习新语言 | 人类可比 | 远低于人类 | 远低于人类 |
- 百万级上下文不是噱头 —— 1.5 Pro 在真实任务(整本书 QA、长视频分析、完整语法学习)上展示了不可替代的价值
- 从长上下文中学”新技能”(Kalamang)是比检索更难也更有价值的基准 —— 代表模型从大量信息中提取模式的能力
- 蒸馏(Flash from Pro)是扩展模型经济性最高效的方法 —— Flash 用极小的质量代价换来了推理速度的大幅提升
- Sparse MoE 是百万级上下文的必要架构选择 —— dense 模型的显存和计算开销在 10M tokens 时无法承受
- 长上下文的胜利也是基础设施的胜利 —— TPUv4 pods、高效分布式训练、高质量数据管线共同支撑了 10M 上下文