奖励模型的离散化

Hugging Face Daily Papers 论文

摘要

本文指出了连续奖励模型在强化学习中的过度敏感问题,即同等质量的回复被赋予不同的分数,并提出了一种使用蒙特卡洛dropout的离散化技术,以减少这种过度敏感,同时保持区分能力,从而得到更好的策略并减少奖励破解。

尽管奖励模型被广泛使用,但其在塑造强化学习中的作用仍未被充分理解。奖励模型提供了一个诱人的承诺:在没有验证者或人类评判的情况下自动估计回复质量。与通常产生二元分数的“可验证奖励”不同,奖励模型通常产生连续分数,使其能够敏感地捕捉回复中的细微差异。然而,我们表明这一表面上的优势是一个严重的弱点:许多流行的奖励模型过度敏感,对同等质量的回复赋予不同的分数。理论上,我们表明看似完美的奖励模型可能高度过度敏感;实验上,这种过度敏感可能导致不良策略。为了替代现有的“奖励模型准确性”概念,我们建议使用不同的“区分能力”和“特异性”(过度敏感的补集)指标来评估奖励模型。作为解决方案,我们描述了一种无需训练的算法,该算法在任何神经奖励模型上使用蒙特卡洛dropout来生成离散的奖励聚类。理论上,我们证明存在以最小的区分能力损失减少过度敏感的离散化方法;实验上,我们表明,在受控和自然的强化学习场景中,离散化奖励比使用原始奖励训练导致更少的奖励破解和更好的策略。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - 离散化奖励模型

来源: https://huggingface.co/papers/2606.21795

摘要

强化学习中的奖励模型存在过度敏感问题,即对同样优质的回应赋予不同分数,导致策略学习效果不佳。而离散化技术能在保持判别能力的同时降低过度敏感性,从而缓解这一问题。

尽管被广泛使用,但奖励模型在塑造强化学习中的作用仍未被充分理解。奖励模型提供了一个诱人的前景:在没有验证器或人工评判的情况下,自动估计回应质量。与通常产生二元分数的“可验证奖励“不同,奖励模型通常给出连续分数,从而能够对回应中的细微差异保持敏感。然而,我们指出这一表面优势实为严重缺陷:许多流行的奖励模型过于敏感,对同样优质的回应给出不同的分数。理论上,我们证明了看似完美的奖励模型可能高度敏感;实验上,这种过度敏感会导致糟糕的策略。我们提议摒弃现有的“奖励模型准确率“概念,转而使用“判别能力“和“特异性“(过度敏感的互补指标)这两个独立指标来评估奖励模型。作为解决方案,我们描述了一种免训练算法,该算法对任何神经奖励模型应用蒙特卡洛dropout,从而生成离散奖励簇。理论上,我们证明存在以最小化判别能力损失为代价降低过度敏感性的离散化方案;实验上,我们在受控和自然强化学习环境中均表明,对奖励进行离散化比基于原始奖励训练更能减少奖励黑客行为,并产生更好的策略。

查看 arXiv 页面 (https://arxiv.org/abs/2606.21795)查看 PDF (https://arxiv.org/pdf/2606.21795)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.21795)

在您的 agent 中获取本文:

hf papers read 2606\.21795

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接本文

请在模型 README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。

引用本文的数据集0

没有数据集链接本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。

引用本文的 Spaces0

没有 Space 链接本文

请在 Space README.md 中引用 arxiv.org/abs/2606.21795 以从本页链接。

包含本文的集合0

没有集合包含本文

请将本文添加到一个集合 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

奖励模型可能过于敏感(22分钟阅读)

TLDR AI

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。

强化学习中的多模态奖励破解

arXiv cs.AI

本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。

Multiscale Reward Hedging from Correct Demonstrations

arXiv cs.LG

This paper presents a multiscale reward hedging method for learning from correct demonstrations, extending guarantees to continuous reward classes with a horizon-free bound via metric entropy, and shows polynomial-time cases for specific settings.