跳转到内容

DeepSeek-OCR — 光学 2D 映射的长上下文压缩

发布日期: 2025-10-24 来源: arXiv 2510.18234 工程范式: 用视觉 2D 映射替代传统 LLM 文本压缩——光学压缩新方向。

DeepSeek-OCR 的出发点不是传统的 OCR 改进,而是探索一个更大胆的假设:能否通过光学 2D 映射(将文本渲染为图像)来压缩长上下文?核心思路是将大量文本渲染成图像,用视觉编码器(DeepEncoder)压缩为少量 vision token,再用一个小 MoE 模型解码回文本。DeepEncoder 的关键特性是”高分辨率输入下保持低激活值”,从而实现高压缩比。这在思路上与 C4、Rusty 等文本压缩方法完全不同——不是减少 token 数量,而是将上下文从文本模态转移到视觉模态,利用视觉编码器的信息压缩能力。

  • DeepEncoder: 专为高压缩比设计的视觉编码器,高分辨率输入下保持低激活值
  • Decoder: DeepSeek-3B-MoE-A570M(仅 570M 激活参数),将视觉 token 解码为文本
  • 压缩比: 当文本 token 数 ≤ 视觉 token 数的 10 倍时,OCR 精度达 97%;即使 20 倍压缩比仍保持约 60%
  • 生产效率: 单张 A100-40G 日产 20 万+页训练数据

在 OmniDocBench 上,DeepSeek-OCR 仅用 100 vision tokens 超越 GOT-OCR2.0(需 256 tokens/page),用不足 800 vision tokens 超越 MinerU2.0(平均 6000+ tokens/page)。20x 压缩比下 60% 精度说明该方法在极端压缩场景仍有可用性。

与 GOT-OCR2.0、MinerU 等传统 OCR 方案相比,DeepSeek-OCR 的独特之处在于不追求精确重构所有文本,而是探索视觉压缩作为长上下文处理的新范式。思路更接近 LLM 的长期记忆/压缩检索,而非传统文档 OCR。

  1. 光学压缩为长上下文处理提供了区别于 token 压缩的新维度
  2. <10x 压缩比是安全操作区域,精度损失可忽略
  3. 该方法擅长大规模训练数据生成——日产 20 万页是量产级别的效率
  4. 视觉编码器的”低激活值高压缩比”设计理念可用于其他跨模态压缩场景