GLM-4-9B — 开源双语多模态对话模型
GLM-4-9B
Section titled “GLM-4-9B”发布日期: 2024-06-05
来源: arXiv 2406.12793, Hugging Face zai-org/glm-4-9b-chat
工程范式: 开源小模型对标——9B 参数在 128K 上下文下对标 Llama 3 8B。
GLM-4-9B 是 GLM-4 系列的开源版本,延续 ChatGLM 开源传统的同时,将规模从 6B 提升到 9B。关键变化:
- 规模升级:从 6B → 9B,参数量增长 50%
- 上下文大幅扩展:128K(开源版本),1M(实验版本)
- 多模态扩展:GLM-4V-9B(视觉语言模型)
定位:在 9B 级别与 Llama 3 8B 正面竞争,在中文任务上具备显著优势。
关键架构决策
Section titled “关键架构决策”- 基于 GLM-4 架构(深度、宽度缩减版本)
- 128K 上下文(开源),支持扩展到 1M(约 200 万中文字符)
- GQA + RoPE + RMSNorm + SwiGLU
- Hugging Face 集成(transformers >= 4.44.0)
- GLM-4V-9B:基于 GLM-4-9B 的视觉语言模型
- 支持图像理解和对话
| 基准 | GLM-4-9B-Chat | Llama-3-8B-Instruct | Qwen2-7B-Instruct |
|---|---|---|---|
| MMLU | 72.4 | ~66 | ~70 |
| GSM8K | 79.6 | - | - |
| MATH | 50.6 | - | - |
| BBH | 76.3 | - | - |
| GPQA | 28.8 | - | - |
| HumanEval | 71.8 | ~62 | ~70 |
- 在 6 个多语言数据集上全面超越 Llama-3-8B-Instruct
- 128K 长上下文检索近乎完美(NIAH 测试)
- 开源协议:Apache 2.0
- 被广泛下载和二次开发
- 触发国内大模型价格战(极低 API 价格)
| 维度 | GLM-4-9B | Llama 3 8B | Qwen2-7B |
|---|---|---|---|
| 上下文 | 128K (1M 实验) | 8K | 32K |
| 多模态 | GLM-4V-9B | 无 | Qwen-VL |
| 中文 | 原生优势 | 较弱 | 原生优势 |
| 开源协议 | Apache 2.0 | Llama 3 | 自定义 |
可复用的工程经验
Section titled “可复用的工程经验”- 9B 是”开源良品”的甜蜜点——比 6B 更强,比 70B 更易部署。
- 128K 上下文在小模型上的实现证明长上下文能力不依赖大模型。
- 1M 上下文(实验性)展示了技术方向——即使只有 9B 参数,也可以处理书籍长度的输入。
- 开源触发价格战——GLM-4-9B 的超低定价策略重塑了中国 LLM API 市场格局。