发布日期: 2024-01-16(GLM-4 初始版本),2024-05-20(GLM-4 0520 更新)
来源: arXiv 2406.12793
工程范式: ChatGLM 家族旗舰——从 130B 到 4 All Tools 的全链路工程积累。
GLM-4 是 ChatGLM 系列的第四代旗舰。arXiv 2406.12793 统一总结了从 GLM-130B 到 GLM-4 All Tools 的全家族演进。核心突破在于:
- “All Tools”理念:模型自动判断何时使用 web 浏览器、Python 解释器、文生图(CogView3)和用户自定义函数。
- 128K 上下文:首次在旗舰模型上达到 GPT-4 Turbo 级别的上下文长度。
- 中文对齐全面超越 GPT-4:AlignBench 上 GLM-4 (0520) 以 8.00 分与 GPT-4 Turbo 持平。
报告明确提出:“GLM-4 closely rivals or outperforms GPT-4 in terms of general metrics such as MMLU, GSM8K, MATH, BBH, GPQA, and HumanEval。“
| 代际 | 时间 | 关键改进 |
|---|
| GLM-130B | 2022-08 | 130B 参数,400B tokens,匹配 GPT-3 |
| ChatGLM-6B | 2023-03 | 6.2B 对话对齐,消费级 GPU |
| ChatGLM2-6B | 2023-06 | MQA + FlashAttention,32K 上下文 |
| ChatGLM3-6B | 2023-10 | Function Call,Code Interpreter,Agent |
| GLM-4 | 2024-01 | 128K 上下文,All Tools,中文对齐领先 |
- 预训练数据:~10 万亿 tokens,中英为主 + 24 种语言
- 架构改进:
- RMSNorm + SwiGLU(替代 LayerNorm + ReLU)
- RoPE 扩展到 2D(针对 GLM 架构的定制)
- GQA(Group Query Attention)替代 MHA,减少 KV 缓存
- 增大 FFN 维度(d_ffn = 10/3 × hidden_size)
- 无 Bias 除 QKV 外:改善长度外推
- 上下文扩展:2K → 32K → 128K (+ 1M 实验性)
- 管线:用户请求 → 规划 → 分析 → 执行工具(递归) → 反馈 → 最终答案
- 支持工具:Web 浏览器、Python 解释器、CogView3(文生图)、用户定义函数
- 支持 自定义 GLM(Agents)(用户定义 API + 外部知识库)
- SFT:真实人类 prompt + 交互
- RLHF:安全性、事实性、相关性、帮助性、偏好
- 标注管道:内部标注 + 第三方(严格质量控制)
| 模型 | MMLU | GSM8K | MATH | BBH | GPQA | HumanEval |
|---|
| GPT-4 (0314) | 86.4 | 92.0 | 52.9 | 83.1 | 35.7 | 67.0 |
| GPT-4 Turbo | 86.7 | 95.6 | 73.4 | 88.2 | 49.3 | 88.2 |
| Claude 3 Opus | 86.8 | 95.0 | 60.1 | 86.8 | 50.4 | 84.9 |
| GLM-4 (0520) | 83.3 | 93.3 | 61.3 | 84.7 | 39.9 | 78.5 |
| GLM-4-Air (0605) | 81.9 | 90.9 | 57.9 | 80.4 | 38.4 | 75.7 |
- GLM-4 达到 GPT-4 的 96.3% MMLU 精度,在部分基准上超过 GPT-4
| 模型 | 松散(英文) | 松散(中文) |
|---|
| GPT-4 Turbo | 88.7 | 79.3 |
| GLM-4 (0520) | 85.0 | 78.0 |
| Claude 3 Opus | 85.5 | 78.3 |
严格模式下,GLM-4 达到 GPT-4 Turbo 的 99.0%(英文)和 98.6%(中文)。
| 模型 | 总分 |
|---|
| GPT-4 Turbo | 8.00 |
| GLM-4 (0520) | 8.00 |
- 在访问网络信息、Python 解数学题等任务上匹配甚至超越 GPT-4 All Tools
- 在一系列智能体任务上表现强劲
| 维度 | GLM-4 | GPT-4 | Claude 3 |
|---|
| 中英双语 | ✅ 原生 | ❌ 非原生 | ❌ 非原生 |
| 中文对齐 | 8.00 | 8.00 | 7.53 |
| All Tools | ✅ | ✅ | 部分 |
| 128K 上下文 | ✅ | ✅ | ✅ |
| 模型信息公开 | 详细 | 几乎不公开 | 部分 |
- “All Tools”的产品理念让模型从”聊天”进化到”做事”,是 LLM 产品化的关键方向。
- 中文对齐可以超越 GPT-4——证明非英语 LLM 可以通过专注的数据和训练策略在母语上超越通用模型。
- GQA + RoPE + RMSNorm + SwiGLU 是通用架构选择——GLM-4 证明这些组件在双语场景下同样有效。
- 十万亿 token 的预训练规模是中英双语模型达到 GPT-4 级别的基础。
- 从 6B 到旗舰的完整产品线——开源小模型获社区反馈,闭源大模型赚钱,形成良性生态循环。