DeepSeek-GRM — 自我原则批评微调与推理时扩展
DeepSeek-GRM
Section titled “DeepSeek-GRM”发布日期: 2025-04-03 来源: arXiv 2504.02495 工程范式: 通用奖励模型的自我原则批评微调(SPCT)与推理时计算扩展。
奖励模型是 RL 后训练的核心瓶颈。传统标量 RM 无法表达多维评价标准,配对 RM 难以扩展。DeepSeek-GRM 的核心洞察是:生成式奖励模型(GRM)通过自然语言输出评分理由,天然支持推理时扩展。即:采样更多 GRM 响应并进行投票,效果可以提升。SPCT 训练方法进一步放大了这种可扩展性:通过拒绝采样微调(冷启动)和基于规则的在线 RL 两个阶段,教会模型在评分前自动生成评价原则(principle),再根据原则给出评分。关键发现是”自生成的 principles 几乎不提升性能,过滤后的 principles 才有效”——说明模型需要外部监督来校准自身的评价标准。
关键架构决策
Section titled “关键架构决策”- 任务形式: Pointwise GRM——对任意数量响应输出 1-10 离散评分 + 自然语言评价 + 评价原则
- SPCT 两阶段: 阶段一拒绝采样微调(Rejective FT,用 hint 采样处理困难样本),阶段二基于规则的在线 GRPO(奖励来自正确排名/打分)
- 推理时扩展: 并行采样 → 投票(点估计求和)→ Meta RM(小标量 RM 筛选高置信度样本后再投票)
- 基座: Gemma-2-27B(主要实验),也在 DeepSeek-V2/V3 上验证
DeepSeek-GRM-27B + MetaRM Voting@32 在 RewardBench 上达 90.4%,全面超越 GPT-4o(71.3%)、Nemotron-4-340B(70.5%)。推理时 32 样本的 27B 模型(88.5%)超越 671B 贪婪解码(88.4%),证明推理时计算可替代训练时模型扩展。SPCT 消融:无 principle 降 2.4pp,无拒绝采样降 1.2pp,无通用指令数据降 6.6pp。
与传统标量 RM 相比,GRM 兼具可解释性和推理时可扩展性。与 Pairwise RM 相比,Pointwise GRM 支持任意数量候选的灵活评分。MetaRM 机制本质上是”评分器的评分器”,类似 RLHF 中的 reward model 蒸馏思路。
可复用工程经验
Section titled “可复用工程经验”- 生成式 RM 的推理时扩展收益可观——32 样本的 27B 可匹配 671B 标量 RM
- SPCT 训练范式(冷启动 + 在线 RL)在奖励建模领域同样有效
- “自生成原则需要外部过滤”是重要发现——自我改进存在天花板
- Meta RM + 投票是简单高效的推理时扩展方案