跳转到内容

Gemini 1.0 — 首个原生多模态模型家族

发布日期: 2023-12-06
来源: arXiv 2312.11805
工程范式: Agentic 能力密度路线——从设计之初就是原生多模态的通用智能模型。

Gemini 1.0 是 Google DeepMind 首个 从设计之初就是原生多模态 的模型家族,涵盖图像、音频、视频、文本的全模态理解和推理。关键差异于 GPT-4V 的”文本模型加视觉适配器”路线——Gemini 从一开始就统一处理所有模态。

三个规模(Ultra / Pro / Nano)覆盖从复杂推理任务到设备端场景的完整用例。

核心成就:在 32 个基准中 30 个达到 SOTA,并首次在 MMLU 上达到超越人类专家的水平(90.04%)。

  • 原生多模态: 单一模型架构从头训练处理所有模态,非多模型拼装
  • 模型系列: Ultra(最强)、Pro(均衡)、Nano(设备端)
  • 编码器: 统一的视觉-语言编码,非独立视觉编码器 + 语言模型
  • 训练基础设施: 使用 TPUv5e 和 TPUv4 集群
  • 负责任部署: 通过 Gemini、Gemini Advanced、Google AI Studio、Cloud Vertex AI 多通道分发
基准类别Gemini Ultra 结果SOTA 表现
总体基准 (32个)30 个 SOTA30/32
文本+推理 (12个)10 个 SOTA10/12
图像理解 (9个)9 个 SOTA9/9
视频理解 (6个)6 个 SOTA6/6
语音识别+翻译 (5个)5 个 SOTA5/5
MMLU90.04%首个超越人类专家 (89.8%)
基准Gemini UltraGPT-4PaLM 2-L
MMLU90.04%86.4%78.2%
GSM8K94.4%92.0%80.7%
MATH53.2%52.9%33.6%
HumanEval74.4%67.0%-
基准Gemini UltraGPT-4V
MMMU59.4%56.8%
MathVista57.5%49.9%
ChartQA83.5%78.5%
InfographicVQA80.3%75.2%
维度Gemini 1.0 (原生多模态)GPT-4V (文本+视觉适配)Claude 3
多模态设计从头统一训练文本模型+视觉头文本为主
模态覆盖文本+图像+音频+视频文本+图像文本+图像
设备端✅ Nano 版本
开源规模❌ (除 Gemma)
  1. 原生多模态训练比后期适配更有效 —— Gemini 在所有多模态基准上全面超过 GPT-4V
  2. 多规模模型家族(Ultra/Pro/Nano)是覆盖广泛用例的最佳策略 —— 从云到设备端的统一架构
  3. MMLU 90.04% 超越人类专家是重要的里程碑信号 —— AI 在广泛知识测试上首次超过人类平均水平
  4. Nano 模型的设备端能力是差异化竞争优势 —— 离线推理、低延迟隐私保护场景不可替代
  5. 1351 位作者的团队规模反映了训练前沿模型的组织复杂度 —— 模型开发已从”研究项目”变为”系统级工程”