跳转到内容

GLM-OCR — 0.9B 参数极致轻量的文档理解多模态模型

发布日期: 2026-03-11 来源: https://arxiv.org/abs/2603.10910 工程范式: 极致参数量效率(0.9B 全参数,无 MoE)+ 多 token 并行预测 + 两阶段流水线架构

核心约束:文档理解在实际生产系统中需要同时满足(1)强性能(表格/公式/印章等复杂内容)、(2)高吞吐低延迟推理、(3)灵活集成与领域适配。GLM-OCR 选择用极小的全参数模型(0.9B)而非大模型来达成这三个目标。

设计选择:

  • 宁可模型小,不可剪裁多:0.9B 全参数,不用 MoE,确保推理无需跨专家路由开销
  • 确定性 OCR 任务与自回归解码的 mismatch:OCR 是确定性映射(图→文本),标准自回归解码的逐 token 生成效率低下——引入 Multi-Token Prediction(MTP)每步预测多个 token
  • 分工明确的两阶段架构:先布局分析(PP-DocLayout-V3),再并行区域级识别——布局分析结果既是结构化依据也是并行化的基础
  • 视觉编码器:CogViT,0.4B 参数
  • 语言解码器:GLM decoder,0.5B 参数
  • 总参数量:0.9B(无比 MoE、无额外语言模型作为编码替换)
  • Multi-Token Prediction (MTP):每步预测多个 token,共享参数减少内存开销
  • 全局部因果注意力模式:MTP 在全局因果 attention 下并行预测多个 token
  • 系统流水线:PP-DocLayout-V3(布局分析)→ 并行区域识别(支持表格/公式/文字/印章等类型)
  • 0.9B 是全模型参数量(非 MoE 激活参数)——推理时不需要跨设备通信
  • MTP 针对 OCR 的确定性输出特性优化——相比标准多 token 预测在开放生成中的质量损失,OCR 的输出 token 序列在很大程度上由输入图像决定,MTP 的精度损失有限
  • 两阶段设计解耦了”找到内容在哪”和”识别内容是什么”——布局分析可以复用通用检测模型(PP-DocLayout-V3),区域识别可以并行化

来源:原文公开数据

评测(OmniDocBench v1.5)GLM-OCR (0.9B)
整体性能90+ 分
文本转录SOTA 级别
公式转录SOTA 级别
表格结构恢复SOTA 级别
关键信息提取SOTA 级别

来源:外部引用(Real5-OmniDocBench, arXiv 2603.04205)显示 GLM-OCR 在 OmniDocBench 上达到约 90.32-92.67% 的综合分数。

(原文未公开每个细分 benchmark 的精确数字,上述数字来自第三方引用。)

维度GLM-OCR (0.9B)PaddleOCR-VLGPT-4o / Gemini(通用大模型)
参数量0.9B(全参数)0.9B(全参数)数百 B
推理速度极快(无 MoE)
MTP✅ 支持
训练数据原文未公开百万级文档数 T token
定位端侧/生产级文档 OCR文档解析通用多模态

PaddleOCR-VL-1.6 随后于 2026 年 6 月以 0.9B 参数达到 OmniDocBench v1.6 的 96.33%——说明 0.9B 级别参数量足以支撑文档理解任务,竞争方向转向数据质量和 post-training 方法。

  1. 任务特性决定架构选择:OCR 是确定性输出任务,MTP 在这里比在开放生成中更适合——这是”任务特化模型”的典型设计思路
  2. 两阶段流水线的复用价值:布局分析(PP-DocLayout-V3)+ 区域识别解耦了通用检测和专用识别,检测模块可以复用生态中已有的模型
  3. 全参数模型的 edge 优势:在 0.9B 量级,不需要 MoE 的跨设备路由,单 GPU 可承载,部署和维护成本远低于大模型方案
  4. 共享参数的 MTP 内存优化:多个预测头共享底层参数,避免多 token 预测的内存开销线性增长