并非每种评分标准都同样有效:面向策略感知的评分标准奖励用于RLVR
摘要
本文提出POW3R,一种面向策略感知的评分标准奖励框架,用于可验证奖励的强化学习(RLVR)。它表明静态评分标准聚合会错误分配学习信号,而POW3R在多种设置下实现了更快的收敛和更好的性能。
查看缓存全文
缓存时间: 2026/05/20 22:40
论文页面 - 并非每条评分标准都同等有效:面向 RLVR 的策略感知评分标准奖励
来源:https://huggingface.co/papers/2605.20164
“并非每条评分标准都同等有效:面向 RLVR 的策略感知评分标准奖励”
随着强化学习后训练扩展到完全可验证领域之外,评分标准(即检查清单)正成为开放式和多模态任务中常见的奖励接口。
我们研究的问题是:用来定义最终答案质量的同一套评分标准权重,是否也应该决定当前策略在强化学习过程中学到什么?
我们的发现是否定的——某个标准可能对最终回答很重要,但如果所有采样输出都通过它,或者所有采样输出都未通过它,那么它就无法提供基于群体相对性的学习信号。在我们的多模态设置和 HealthBench 上,大约一半的评分标准对于新策略来说是“非对比性”的,而静态聚合方法将类别内 45–51% 的训练压力导向了这些标准。
在这项工作中,我们:
- 诊断了静态评分标准聚合如何错误分配学习信号,
- 展示了人类重要性与策略依赖的实用性可能解耦,
- 引入了 POW3R,一个策略感知的评分标准奖励框架,它在保留评估目标的同时,在训练过程中动态调整标准级别的奖励权重。
在三种基础策略以及多模态/纯文本设置下,POW3R 在 24/30 的基础策略/指标比较中胜出,并且仅用 2.5–4× 更少的训练步骤就达到了相同的平稳期。
相似文章
RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习
本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。
SERPO:面向开放式测试时强化学习的自演化评分策略优化
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.
基于评分标准的强化学习中的奖励黑客问题
本文研究了基于评分标准的强化学习中的奖励黑客现象,分析了训练验证器与评估指标之间的分歧。文章提出了一种针对“自我内化差距”的诊断方法,并证明更强的验证能力虽然能减少但无法完全消除奖励黑客问题。