跳转到内容

GLM-4-9B — 开源双语多模态对话模型

发布日期: 2024-06-05
来源: arXiv 2406.12793, Hugging Face zai-org/glm-4-9b-chat
工程范式: 开源小模型对标——9B 参数在 128K 上下文下对标 Llama 3 8B。

GLM-4-9B 是 GLM-4 系列的开源版本,延续 ChatGLM 开源传统的同时,将规模从 6B 提升到 9B。关键变化:

  1. 规模升级:从 6B → 9B,参数量增长 50%
  2. 上下文大幅扩展:128K(开源版本),1M(实验版本)
  3. 多模态扩展:GLM-4V-9B(视觉语言模型)

定位:在 9B 级别与 Llama 3 8B 正面竞争,在中文任务上具备显著优势。

  • 基于 GLM-4 架构(深度、宽度缩减版本)
  • 128K 上下文(开源),支持扩展到 1M(约 200 万中文字符)
  • GQA + RoPE + RMSNorm + SwiGLU
  • Hugging Face 集成(transformers >= 4.44.0)
  • GLM-4V-9B:基于 GLM-4-9B 的视觉语言模型
  • 支持图像理解和对话
基准GLM-4-9B-ChatLlama-3-8B-InstructQwen2-7B-Instruct
MMLU72.4~66~70
GSM8K79.6--
MATH50.6--
BBH76.3--
GPQA28.8--
HumanEval71.8~62~70
  • 在 6 个多语言数据集上全面超越 Llama-3-8B-Instruct
  • 128K 长上下文检索近乎完美(NIAH 测试)
  • 开源协议:Apache 2.0
  • 被广泛下载和二次开发
  • 触发国内大模型价格战(极低 API 价格)
维度GLM-4-9BLlama 3 8BQwen2-7B
上下文128K (1M 实验)8K32K
多模态GLM-4V-9BQwen-VL
中文原生优势较弱原生优势
开源协议Apache 2.0Llama 3自定义
  1. 9B 是”开源良品”的甜蜜点——比 6B 更强,比 70B 更易部署。
  2. 128K 上下文在小模型上的实现证明长上下文能力不依赖大模型。
  3. 1M 上下文(实验性)展示了技术方向——即使只有 9B 参数,也可以处理书籍长度的输入。
  4. 开源触发价格战——GLM-4-9B 的超低定价策略重塑了中国 LLM API 市场格局。