GLM-OCR — 0.9B 参数极致轻量的文档理解多模态模型
GLM-OCR — 紧凑多模态文档理解
Section titled “GLM-OCR — 紧凑多模态文档理解”发布日期: 2026-03-11 来源: https://arxiv.org/abs/2603.10910 工程范式: 极致参数量效率(0.9B 全参数,无 MoE)+ 多 token 并行预测 + 两阶段流水线架构
核心约束:文档理解在实际生产系统中需要同时满足(1)强性能(表格/公式/印章等复杂内容)、(2)高吞吐低延迟推理、(3)灵活集成与领域适配。GLM-OCR 选择用极小的全参数模型(0.9B)而非大模型来达成这三个目标。
设计选择:
- 宁可模型小,不可剪裁多:0.9B 全参数,不用 MoE,确保推理无需跨专家路由开销
- 确定性 OCR 任务与自回归解码的 mismatch:OCR 是确定性映射(图→文本),标准自回归解码的逐 token 生成效率低下——引入 Multi-Token Prediction(MTP)每步预测多个 token
- 分工明确的两阶段架构:先布局分析(PP-DocLayout-V3),再并行区域级识别——布局分析结果既是结构化依据也是并行化的基础
关键架构决策
Section titled “关键架构决策”- 视觉编码器:CogViT,0.4B 参数
- 语言解码器:GLM decoder,0.5B 参数
- 总参数量:0.9B(无比 MoE、无额外语言模型作为编码替换)
- Multi-Token Prediction (MTP):每步预测多个 token,共享参数减少内存开销
- 全局部因果注意力模式:MTP 在全局因果 attention 下并行预测多个 token
- 系统流水线:PP-DocLayout-V3(布局分析)→ 并行区域识别(支持表格/公式/文字/印章等类型)
技术选型的关键特征
Section titled “技术选型的关键特征”- 0.9B 是全模型参数量(非 MoE 激活参数)——推理时不需要跨设备通信
- MTP 针对 OCR 的确定性输出特性优化——相比标准多 token 预测在开放生成中的质量损失,OCR 的输出 token 序列在很大程度上由输入图像决定,MTP 的精度损失有限
- 两阶段设计解耦了”找到内容在哪”和”识别内容是什么”——布局分析可以复用通用检测模型(PP-DocLayout-V3),区域识别可以并行化
来源:原文公开数据
| 评测(OmniDocBench v1.5) | GLM-OCR (0.9B) |
|---|---|
| 整体性能 | 90+ 分 |
| 文本转录 | SOTA 级别 |
| 公式转录 | SOTA 级别 |
| 表格结构恢复 | SOTA 级别 |
| 关键信息提取 | SOTA 级别 |
来源:外部引用(Real5-OmniDocBench, arXiv 2603.04205)显示 GLM-OCR 在 OmniDocBench 上达到约 90.32-92.67% 的综合分数。
(原文未公开每个细分 benchmark 的精确数字,上述数字来自第三方引用。)
| 维度 | GLM-OCR (0.9B) | PaddleOCR-VL | GPT-4o / Gemini(通用大模型) |
|---|---|---|---|
| 参数量 | 0.9B(全参数) | 0.9B(全参数) | 数百 B |
| 推理速度 | 极快(无 MoE) | 快 | 慢 |
| MTP | ✅ 支持 | ❌ | ❌ |
| 训练数据 | 原文未公开 | 百万级文档 | 数 T token |
| 定位 | 端侧/生产级文档 OCR | 文档解析 | 通用多模态 |
PaddleOCR-VL-1.6 随后于 2026 年 6 月以 0.9B 参数达到 OmniDocBench v1.6 的 96.33%——说明 0.9B 级别参数量足以支撑文档理解任务,竞争方向转向数据质量和 post-training 方法。
可复用的工程经验
Section titled “可复用的工程经验”- 任务特性决定架构选择:OCR 是确定性输出任务,MTP 在这里比在开放生成中更适合——这是”任务特化模型”的典型设计思路
- 两阶段流水线的复用价值:布局分析(PP-DocLayout-V3)+ 区域识别解耦了通用检测和专用识别,检测模块可以复用生态中已有的模型
- 全参数模型的 edge 优势:在 0.9B 量级,不需要 MoE 的跨设备路由,单 GPU 可承载,部署和维护成本远低于大模型方案
- 共享参数的 MTP 内存优化:多个预测头共享底层参数,避免多 token 预测的内存开销线性增长