跳转到内容

DeepSeek-GRM — 自我原则批评微调与推理时扩展

发布日期: 2025-04-03 来源: arXiv 2504.02495 工程范式: 通用奖励模型的自我原则批评微调(SPCT)与推理时计算扩展。

奖励模型是 RL 后训练的核心瓶颈。传统标量 RM 无法表达多维评价标准,配对 RM 难以扩展。DeepSeek-GRM 的核心洞察是:生成式奖励模型(GRM)通过自然语言输出评分理由,天然支持推理时扩展。即:采样更多 GRM 响应并进行投票,效果可以提升。SPCT 训练方法进一步放大了这种可扩展性:通过拒绝采样微调(冷启动)和基于规则的在线 RL 两个阶段,教会模型在评分前自动生成评价原则(principle),再根据原则给出评分。关键发现是”自生成的 principles 几乎不提升性能,过滤后的 principles 才有效”——说明模型需要外部监督来校准自身的评价标准。

  • 任务形式: Pointwise GRM——对任意数量响应输出 1-10 离散评分 + 自然语言评价 + 评价原则
  • SPCT 两阶段: 阶段一拒绝采样微调(Rejective FT,用 hint 采样处理困难样本),阶段二基于规则的在线 GRPO(奖励来自正确排名/打分)
  • 推理时扩展: 并行采样 → 投票(点估计求和)→ Meta RM(小标量 RM 筛选高置信度样本后再投票)
  • 基座: Gemma-2-27B(主要实验),也在 DeepSeek-V2/V3 上验证

DeepSeek-GRM-27B + MetaRM Voting@32 在 RewardBench 上达 90.4%,全面超越 GPT-4o(71.3%)、Nemotron-4-340B(70.5%)。推理时 32 样本的 27B 模型(88.5%)超越 671B 贪婪解码(88.4%),证明推理时计算可替代训练时模型扩展。SPCT 消融:无 principle 降 2.4pp,无拒绝采样降 1.2pp,无通用指令数据降 6.6pp。

与传统标量 RM 相比,GRM 兼具可解释性和推理时可扩展性。与 Pairwise RM 相比,Pointwise GRM 支持任意数量候选的灵活评分。MetaRM 机制本质上是”评分器的评分器”,类似 RLHF 中的 reward model 蒸馏思路。

  1. 生成式 RM 的推理时扩展收益可观——32 样本的 27B 可匹配 671B 标量 RM
  2. SPCT 训练范式(冷启动 + 在线 RL)在奖励建模领域同样有效
  3. “自生成原则需要外部过滤”是重要发现——自我改进存在天花板
  4. Meta RM + 投票是简单高效的推理时扩展方案