跳转到内容

DeepSeek-V3.2 — 稀疏注意力 + 可扩展 RL,开源模型逼近 GPT-5

发布日期: 2025-12-02 来源: arXiv 2512.02556 工程范式: 稀疏注意力 + 可扩展强化学习 + 大规模 Agent 数据合成 — 在推理和 Agent 能力上同时逼近闭源前沿。

DeepSeek-V3.2 的设计哲学可以概括为两条核心信念。第一,后训练计算的扩展(post-training compute scaling)是当前能力提升的核心杠杆。V3.2 没有在预训练阶段堆叠 10× 参数量,而是将主要差异化能力(推理、Agent、工具使用)推入后训练,通过强化学习框架和合成数据管线释放潜力。第二,稀疏注意力是长上下文场景下兼顾效率与性能的关键路径。V3.2 相信传统 full attention 的 O(n²) 复杂度在大规模部署中不可持续,而精心设计的稀疏机制可以在保持模型表现的同时大幅降低计算负担。

这两个信念的结合产生了 V3.2 的高计算变体 DeepSeek-V3.2-Speciale,它通过在推理时投入更多 RL 后训练计算,超越 GPT-5 并在 2025 年 IMO 和 IOI 上同时获得金牌——这在开源模型中是前所未有的成就。

DSA 是 V3.2 最核心的架构创新。它是一个细粒度的稀疏注意力机制,基于 MLA(Multi-Head Latent Attention)架构实例化,通过一个轻量级索引器(lightning indexer) 为每个查询 token 选择最重要的 2048 个 key-value token。索引器通过 KL 散度损失从模型已有注意力分布学习选择策略,再通过两阶段持续预训练完成过渡:

  • Stage A(密集预热,2.1B tokens): 冻结主模型,仅训练索引器,1000 步,每步 16 条 128K 序列。
  • Stage B(稀疏训练,943.7B tokens): 同时训练主模型和索引器,15000 步,每步 480 条 128K 序列。索引器输入从计算图中分离,索引器仅由索引器损失优化,主模型仅由 LM 损失优化。

这一设计的关键洞察是:稀疏注意力的效率收益依赖于训练数据中真实存在值得跨越长距离关注的依赖关系。V3.2 的持续预训练数据完全对齐 V3.1-Terminus 的 128K 长上下文数据分布,确保模型反复接触有信号的长距离关联。

V3.2 的 RL 框架在 R1 的 GRPO 基础上进一步扩展。论文报告了通过实施稳健的 RL 协议和扩展后训练计算,V3.2 的性能达到了与 GPT-5 可比的水平。其核心创新是混合奖励机制

  • 规则奖励(rule-based rewards): 用于可验证任务(数学、代码),确定性答案匹配和编译器反馈
  • 生成式奖励模型(rubric-driven generative reward models): 用于通用任务,由人类专家审计评分准则、裁决策边界、捕捉奖励黑客行为

V3.2 构建了一个系统性的合成数据生成管线,用于将推理能力整合到工具使用场景中。该管线覆盖 1800+ 环境、85000+ 提示。代码 Agent 数据仅在补丁通过测试且无回归的条件下被接受——验证本身定义了数据集的质量。这一设计使得在复杂交互环境中的泛化能力和指令遵循鲁棒性得到实质性提升。

V3.2 在写作+通用问答基础上,构建了六个专门领域的专家模型(数学、编程、逻辑推理、通用 Agent、编码 Agent、搜索 Agent)。领域专家通过大规模 RL 计算训练,然后作为受控合成数据生成器。值得注意的是,V3.2 区分了思考模式(长 CoT)非思考模式(直接响应),不同模式使用不同专家模型生成数据。

  • DeepSeek-V3.2-Speciale 超越 GPT-5,推理能力与 Gemini-3.0-Pro 相当
  • 同时获得 2025 年 IMO 和 IOI 金牌
  • AIME 2025: V3.2-Speciale 96.0% Pass@1(vs GPT-5-High 93.1%)
  • Codeforces Rating: V3.2-Speciale 2701(vs GPT-5-High 2386)
  • SWE-Bench Verified: V3.2-Speciale 73.1%(vs Claude-4.5-Sonnet 74.9%)
  • Terminal Bench 2.0: V3.2-Speciale 80.3% Acc(vs GPT-5-High 35.2%)
  • Tool Decathlon: V3.2-Speciale 80.2%(vs GPT-5-High 84.7%)

Agent 能力提升尤其显著——Terminal Bench 上 V3.2-Speciale 的 80.3% 远高于 GPT-5-High 的 35.2%,说明 Agent 合成数据管线的有效性。

维度DeepSeek-V3.2GPT-5 (闭源)Gemini-3.0-Pro (闭源)
推理并列/略优 (IMO/IOI 金牌)强但未达金牌并列
AgentTerminal Bench 领先大幅落后
开源✅ 公开权重❌ 闭源❌ 闭源
注意力DSA 稀疏Full Attention未知

V3.2 与 GPT-5/Claude-4.5-Sonnet 的关键区别在于注意力架构和 RL 训练策略。GPT-5 依赖 full attention 和更大量的预训练计算,而 V3.2 用 DSA 降低了推理成本,并通过 RL 后训练大幅缩小了差距。

  1. 后训练计算比预训练计算更有效率提升:V3.2 的绝大部分能力提升来自 RL + Agent 合成数据管线的后训练,而非扩大预训练规模。
  2. 稀疏注意力的效率前提是高质量长序列训练数据:没有真实的跨长距离依赖关系,稀疏机制只会丢失信息。
  3. Agent 能力可以通过验证驱动的合成数据系统性地构建:补丁必须通过测试(pass + 无回归),验证定义数据集质量。
  4. 领域专家蒸馏比统一训练更可控:不同领域独立优化,再作为数据生成器,可以精确控制每个能力维度的训练数据分布。
  5. 混合奖励机制是可扩展 RL 的关键:规则奖励用于可验证任务,生成式奖励模型用于通用任务,人类专家审计兜底。
  6. DSA 的两阶段训练方案(预热索引器 → 联合训练)是可复用的稀疏化过渡范式