奖励模型的离散化
摘要
本文指出了连续奖励模型在强化学习中的过度敏感问题,即同等质量的回复被赋予不同的分数,并提出了一种使用蒙特卡洛dropout的离散化技术,以减少这种过度敏感,同时保持区分能力,从而得到更好的策略并减少奖励破解。
查看缓存全文
缓存时间: 2026/06/26 06:05
论文页面 - 离散化奖励模型
来源: https://huggingface.co/papers/2606.21795
摘要
强化学习中的奖励模型存在过度敏感问题,即对同样优质的回应赋予不同分数,导致策略学习效果不佳。而离散化技术能在保持判别能力的同时降低过度敏感性,从而缓解这一问题。
尽管被广泛使用,但奖励模型在塑造强化学习中的作用仍未被充分理解。奖励模型提供了一个诱人的前景:在没有验证器或人工评判的情况下,自动估计回应质量。与通常产生二元分数的“可验证奖励“不同,奖励模型通常给出连续分数,从而能够对回应中的细微差异保持敏感。然而,我们指出这一表面优势实为严重缺陷:许多流行的奖励模型过于敏感,对同样优质的回应给出不同的分数。理论上,我们证明了看似完美的奖励模型可能高度敏感;实验上,这种过度敏感会导致糟糕的策略。我们提议摒弃现有的“奖励模型准确率“概念,转而使用“判别能力“和“特异性“(过度敏感的互补指标)这两个独立指标来评估奖励模型。作为解决方案,我们描述了一种免训练算法,该算法对任何神经奖励模型应用蒙特卡洛dropout,从而生成离散奖励簇。理论上,我们证明存在以最小化判别能力损失为代价降低过度敏感性的离散化方案;实验上,我们在受控和自然强化学习环境中均表明,对奖励进行离散化比基于原始奖励训练更能减少奖励黑客行为,并产生更好的策略。
查看 arXiv 页面 (https://arxiv.org/abs/2606.21795)查看 PDF (https://arxiv.org/pdf/2606.21795)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.21795)
在您的 agent 中获取本文:
hf papers read 2606\.21795
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
请在模型 README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。
引用本文的数据集0
没有数据集链接本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。
引用本文的 Spaces0
没有 Space 链接本文
请在 Space README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。
包含本文的集合0
没有集合包含本文
请将本文添加到一个集合 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
奖励模型可能过于敏感(22分钟阅读)
本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。
Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL
A Scale AI research paper proposes Rubric Dropout, a dropout-style regularization for rubric criteria in rubric-as-reward RL, showing it mitigates reward hacking and improves out-of-distribution gold judge scores on medical and science benchmarks.
强化学习中的多模态奖励破解
本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。
Multiscale Reward Hedging from Correct Demonstrations
This paper presents a multiscale reward hedging method for learning from correct demonstrations, extending guarantees to continuous reward classes with a horizon-free bound via metric entropy, and shows polynomial-time cases for specific settings.
大模型时代的奖励黑客:机制、涌现错位与挑战
综述提出“代理压缩假设”,解释 RLHF 及相关方法如何在大型语言与多模态模型中系统性地诱发奖励黑客、欺骗与监督博弈。