Gemini 1.0 — 首个原生多模态模型家族
Gemini 1.0
Section titled “Gemini 1.0”发布日期: 2023-12-06
来源: arXiv 2312.11805
工程范式: Agentic 能力密度路线——从设计之初就是原生多模态的通用智能模型。
Gemini 1.0 是 Google DeepMind 首个 从设计之初就是原生多模态 的模型家族,涵盖图像、音频、视频、文本的全模态理解和推理。关键差异于 GPT-4V 的”文本模型加视觉适配器”路线——Gemini 从一开始就统一处理所有模态。
三个规模(Ultra / Pro / Nano)覆盖从复杂推理任务到设备端场景的完整用例。
核心成就:在 32 个基准中 30 个达到 SOTA,并首次在 MMLU 上达到超越人类专家的水平(90.04%)。
关键架构决策
Section titled “关键架构决策”- 原生多模态: 单一模型架构从头训练处理所有模态,非多模型拼装
- 模型系列: Ultra(最强)、Pro(均衡)、Nano(设备端)
- 编码器: 统一的视觉-语言编码,非独立视觉编码器 + 语言模型
- 训练基础设施: 使用 TPUv5e 和 TPUv4 集群
- 负责任部署: 通过 Gemini、Gemini Advanced、Google AI Studio、Cloud Vertex AI 多通道分发
| 基准类别 | Gemini Ultra 结果 | SOTA 表现 |
|---|---|---|
| 总体基准 (32个) | 30 个 SOTA | 30/32 |
| 文本+推理 (12个) | 10 个 SOTA | 10/12 |
| 图像理解 (9个) | 9 个 SOTA | 9/9 |
| 视频理解 (6个) | 6 个 SOTA | 6/6 |
| 语音识别+翻译 (5个) | 5 个 SOTA | 5/5 |
| MMLU | 90.04% | 首个超越人类专家 (89.8%) |
| 基准 | Gemini Ultra | GPT-4 | PaLM 2-L |
|---|---|---|---|
| MMLU | 90.04% | 86.4% | 78.2% |
| GSM8K | 94.4% | 92.0% | 80.7% |
| MATH | 53.2% | 52.9% | 33.6% |
| HumanEval | 74.4% | 67.0% | - |
| 基准 | Gemini Ultra | GPT-4V |
|---|---|---|
| MMMU | 59.4% | 56.8% |
| MathVista | 57.5% | 49.9% |
| ChartQA | 83.5% | 78.5% |
| InfographicVQA | 80.3% | 75.2% |
| 维度 | Gemini 1.0 (原生多模态) | GPT-4V (文本+视觉适配) | Claude 3 |
|---|---|---|---|
| 多模态设计 | 从头统一训练 | 文本模型+视觉头 | 文本为主 |
| 模态覆盖 | 文本+图像+音频+视频 | 文本+图像 | 文本+图像 |
| 设备端 | ✅ Nano 版本 | ❌ | ❌ |
| 开源规模 | ❌ (除 Gemma) | ❌ | ❌ |
可复用的工程经验
Section titled “可复用的工程经验”- 原生多模态训练比后期适配更有效 —— Gemini 在所有多模态基准上全面超过 GPT-4V
- 多规模模型家族(Ultra/Pro/Nano)是覆盖广泛用例的最佳策略 —— 从云到设备端的统一架构
- MMLU 90.04% 超越人类专家是重要的里程碑信号 —— AI 在广泛知识测试上首次超过人类平均水平
- Nano 模型的设备端能力是差异化竞争优势 —— 离线推理、低延迟隐私保护场景不可替代
- 1351 位作者的团队规模反映了训练前沿模型的组织复杂度 —— 模型开发已从”研究项目”变为”系统级工程”