跳转到内容

GLM-4 — ChatGLM 家族旗舰双语大模型

发布日期: 2024-01-16(GLM-4 初始版本),2024-05-20(GLM-4 0520 更新)
来源: arXiv 2406.12793
工程范式: ChatGLM 家族旗舰——从 130B 到 4 All Tools 的全链路工程积累。

GLM-4 是 ChatGLM 系列的第四代旗舰。arXiv 2406.12793 统一总结了从 GLM-130B 到 GLM-4 All Tools 的全家族演进。核心突破在于:

  1. “All Tools”理念:模型自动判断何时使用 web 浏览器、Python 解释器、文生图(CogView3)和用户自定义函数。
  2. 128K 上下文:首次在旗舰模型上达到 GPT-4 Turbo 级别的上下文长度。
  3. 中文对齐全面超越 GPT-4:AlignBench 上 GLM-4 (0520) 以 8.00 分与 GPT-4 Turbo 持平。

报告明确提出:“GLM-4 closely rivals or outperforms GPT-4 in terms of general metrics such as MMLU, GSM8K, MATH, BBH, GPQA, and HumanEval。“

代际时间关键改进
GLM-130B2022-08130B 参数,400B tokens,匹配 GPT-3
ChatGLM-6B2023-036.2B 对话对齐,消费级 GPU
ChatGLM2-6B2023-06MQA + FlashAttention,32K 上下文
ChatGLM3-6B2023-10Function Call,Code Interpreter,Agent
GLM-42024-01128K 上下文,All Tools,中文对齐领先
  • 预训练数据:~10 万亿 tokens,中英为主 + 24 种语言
  • 架构改进
    • RMSNorm + SwiGLU(替代 LayerNorm + ReLU)
    • RoPE 扩展到 2D(针对 GLM 架构的定制)
    • GQA(Group Query Attention)替代 MHA,减少 KV 缓存
    • 增大 FFN 维度(d_ffn = 10/3 × hidden_size)
  • 无 Bias 除 QKV 外:改善长度外推
  • 上下文扩展:2K → 32K → 128K (+ 1M 实验性)
  • 管线:用户请求 → 规划 → 分析 → 执行工具(递归) → 反馈 → 最终答案
  • 支持工具:Web 浏览器、Python 解释器、CogView3(文生图)、用户定义函数
  • 支持 自定义 GLM(Agents)(用户定义 API + 外部知识库)
  • SFT:真实人类 prompt + 交互
  • RLHF:安全性、事实性、相关性、帮助性、偏好
  • 标注管道:内部标注 + 第三方(严格质量控制)
模型MMLUGSM8KMATHBBHGPQAHumanEval
GPT-4 (0314)86.492.052.983.135.767.0
GPT-4 Turbo86.795.673.488.249.388.2
Claude 3 Opus86.895.060.186.850.484.9
GLM-4 (0520)83.393.361.384.739.978.5
GLM-4-Air (0605)81.990.957.980.438.475.7
  • GLM-4 达到 GPT-4 的 96.3% MMLU 精度,在部分基准上超过 GPT-4
模型松散(英文)松散(中文)
GPT-4 Turbo88.779.3
GLM-4 (0520)85.078.0
Claude 3 Opus85.578.3

严格模式下,GLM-4 达到 GPT-4 Turbo 的 99.0%(英文)和 98.6%(中文)。

模型总分
GPT-4 Turbo8.00
GLM-4 (0520)8.00
  • 在访问网络信息、Python 解数学题等任务上匹配甚至超越 GPT-4 All Tools
  • 在一系列智能体任务上表现强劲
维度GLM-4GPT-4Claude 3
中英双语✅ 原生❌ 非原生❌ 非原生
中文对齐8.008.007.53
All Tools部分
128K 上下文
模型信息公开详细几乎不公开部分
  1. “All Tools”的产品理念让模型从”聊天”进化到”做事”,是 LLM 产品化的关键方向。
  2. 中文对齐可以超越 GPT-4——证明非英语 LLM 可以通过专注的数据和训练策略在母语上超越通用模型。
  3. GQA + RoPE + RMSNorm + SwiGLU 是通用架构选择——GLM-4 证明这些组件在双语场景下同样有效。
  4. 十万亿 token 的预训练规模是中英双语模型达到 GPT-4 级别的基础。
  5. 从 6B 到旗舰的完整产品线——开源小模型获社区反馈,闭源大模型赚钱,形成良性生态循环。