并非每种评分标准都同样有效:面向策略感知的评分标准奖励用于RLVR

Hugging Face Daily Papers 论文

摘要

本文提出POW3R,一种面向策略感知的评分标准奖励框架,用于可验证奖励的强化学习(RLVR)。它表明静态评分标准聚合会错误分配学习信号,而POW3R在多种设置下实现了更快的收敛和更好的性能。

可验证奖励的强化学习使得在正确性可自动检查时,后训练变得非常有效。然而,许多重要的模型行为需要同时满足多个定性标准。基于评分标准的奖励通过评估特定提示的标准并将其聚合成标量奖励来解决这一问题。但标准的静态聚合方式将人类赋予标准的重要性与其当前作为优化信号的有效性混为一谈。我们表明,这种假设在评分标准强化学习中不成立:许多重要标准已经饱和或当前无法达到,而区分生成结果的标准不一定具有最大的人类权重。我们提出POW3R,一种面向策略感知的评分标准奖励框架,它在以评分标准目标保持人类权重和类别平衡的同时,在训练过程中调整标准级别的奖励权重。POW3R利用生成结果级别的对比来强调当前区分策略输出的标准,从而使GRPO奖励更具信息性,而不改变底层评估目标。在两种数据集(涵盖多模态和纯文本设置)的三个基础策略上,POW3R在30个基础策略/指标比较中赢得了24个,相比使用评分标准奖励的原始GRPO,既提高了平均评分标准奖励,又提高了严格完成率(响应满足每个所需评分标准标准的提示比例),并且在2.5到4倍的训练步骤内达到相同稳定水平。因此,评分标准奖励应区分最终答案中应重视的内容与当前策略可学习的内容。
查看原文
查看缓存全文

缓存时间: 2026/05/20 22:40

论文页面 - 并非每条评分标准都同等有效:面向 RLVR 的策略感知评分标准奖励

来源:https://huggingface.co/papers/2605.20164

“并非每条评分标准都同等有效:面向 RLVR 的策略感知评分标准奖励”

随着强化学习后训练扩展到完全可验证领域之外,评分标准(即检查清单)正成为开放式和多模态任务中常见的奖励接口。

我们研究的问题是:用来定义最终答案质量的同一套评分标准权重,是否也应该决定当前策略在强化学习过程中学到什么?

我们的发现是否定的——某个标准可能对最终回答很重要,但如果所有采样输出都通过它,或者所有采样输出都未通过它,那么它就无法提供基于群体相对性的学习信号。在我们的多模态设置和 HealthBench 上,大约一半的评分标准对于新策略来说是“非对比性”的,而静态聚合方法将类别内 45–51% 的训练压力导向了这些标准。

在这项工作中,我们:

  • 诊断了静态评分标准聚合如何错误分配学习信号,
  • 展示了人类重要性与策略依赖的实用性可能解耦,
  • 引入了 POW3R,一个策略感知的评分标准奖励框架,它在保留评估目标的同时,在训练过程中动态调整标准级别的奖励权重。

在三种基础策略以及多模态/纯文本设置下,POW3R 在 24/30 的基础策略/指标比较中胜出,并且仅用 2.5–4× 更少的训练步骤就达到了相同的平稳期。

相似文章

RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习

Hugging Face Daily Papers

本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。

基于评分标准的强化学习中的奖励黑客问题

Hugging Face Daily Papers

本文研究了基于评分标准的强化学习中的奖励黑客现象,分析了训练验证器与评估指标之间的分歧。文章提出了一种针对“自我内化差距”的诊断方法,并证明更强的验证能力虽然能减少但无法完全消除奖励黑客问题。