奖励模型可能过于敏感(22分钟阅读)

TLDR AI 论文

摘要

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。

Meta研究了奖励模型如何对同样好的回答反应过度,导致强化学习走向奖励破解。论文提出了同时衡量区分能力和特异性,然后使用Monte Carlo dropout将奖励聚类为更安全的离散信号。
查看原文
查看缓存全文

缓存时间: 2026/06/29 17:15

# 离散化奖励模型  
来源:https://arxiv.org/html/2606.21795  

1\]卡内基梅隆大学 2\]Meta超级智能实验室\\contribution\[\*\]在Meta完成的工作  

Shiqi Wang Devamanyu Hazarika Chirag Nagpal Tongshuang Wu Graham Neubig Yuning Mao  

[[[email protected]](mailto:[email protected]) (2026年6月19日)  

###### 摘要  
尽管奖励模型被广泛使用,但它们在塑造强化学习中的作用却鲜为人知。奖励模型提供了一个诱人的承诺:在没有验证者或人工评审的情况下,自动估计响应质量。与通常产生二元分数的“可验证奖励”不同,奖励模型通常产生连续分数,使其能够对响应中的细微差异敏感。然而,我们表明这一表面上的优势实际上是一个严重弱点:许多流行的奖励模型存在*过度敏感*的问题,即对同样好的响应分配不同的分数。理论上,我们展示了看似完美的奖励模型可能高度过度敏感;经验上,这种过度敏感会导致不良策略。我们提出用“判别能力”和“特异性”(过度敏感的互补指标)这两个不同的指标来评估奖励模型,以取代现有的“奖励模型准确率”概念。作为解决方案,我们描述了一种免训练的算法,该算法对任何神经奖励模型使用蒙特卡洛dropout来生成离散的奖励簇。理论上,我们证明存在以最小牺牲判别能力为代价减少过度敏感的离散化方法;经验上,在受控和自然强化学习设置中,我们发现离散化奖励比使用原始奖励训练导致更少的奖励破解和更好的策略。  

\\correspondence Vijay Viswanathan 于  

## 1 引言  

强化学习的核心特征在于使用*奖励*来评价模型行为,而非显式示范。强化学习在*可验证*问题上已被证明最为可靠,这类问题中程序能够对任何响应进行评分(DeepSeek-AI 等,2025;Lambert 等,2024a;Lin 等,2025)。对于较难验证的任务,标准做法是使用奖励模型(“RM”),通过提示预训练语言模型(Saad-Falcon 等,2025;Tunstall 等,2023;Sun 等,2024;Viswanathan 等,2025)或通过显式训练(Christiano 等,2017;Liu 等,2024a;Wang 等,2024)来评估响应质量。连续值的奖励模型在响应上诱导出严格的全序关系。这提供了二元验证无法捕捉的潜力——奖励部分进步(例如区分“好”与“很好”)以及风格上的优点,而二元通过/失败信号无法做到这一点。  

我们认为这一表面上的优势是一个严重弱点,原因在于*奖励模型过度敏感*。  

参见图注  
图1:奖励模型可能擅长区分“好响应”与“差响应”,但具有低*特异性*(即高*过度敏感*)。给定效用相等的类别,我们可以有 (a) 完美判别但差特异性;(b) 完美特异性但差判别;(c) 使用离散化在两者上都完美。  

基准测试表明,奖励建模问题几乎已经解决。奖励模型与标注偏好的一致性非常高;在RewardBench 1和2(Lambert等,2024b;Malik等,2025)上,顶级模型分别达到94%和84%的一致性。我们认为*奖励建模并未解决*,理解这一点需要重新思考我们如何*使用*和*评估*奖励模型。奖励模型评估通常假设一个响应总是优于其他响应(Lambert等,2024b;Liu等,2024b;Malik等,2025)。¹¹一个重要的例外是RewardBench 2中的“Ties”子集,我们将在第4.1节中更详细地讨论。该子集是过度敏感的一个代理,但它仅贡献了Reward Bench平均分的1/16。类似地,许多强化学习算法优化每个响应的奖励与一批响应平均奖励之间的差异。  

参见图注  
图2:我们建议通过奖励模型的*判别能力*(区分好响应与差响应)和*特异性*(识别同样好的响应)来衡量它们。领先的RM(Liu等,2024a;Wang等,2024)显示出强判别能力但差特异性。  

这一假设显然是错误的。大多数提示可以用多种同样有用的方式回答,例如“说出2019年温布尔登冠军的名字”(如图2所示)。在这一组同样有用的响应中(例如女子单打冠军 vs. 男子双打冠军),平均人类偏好通常应该是相等的;如果不相等,则属于“评分不确定性”的伪像,即偏好源于个人背景、主观解释或有害偏见,而非客观差异(Guerdan等,2025)。奖励模型训练也是一个不完美的过程,由此产生的RM训练在此类数据上,同时建模了客观效用信号和虚假的评分伪像(如隐含偏见)(Liu等,2024a, 2025;Wang等,2024;Yang等,2024)。当奖励模型给同样好的响应分配不同分数时,它并非在进行*判别*——而是*过度敏感*。我们表明过度敏感不仅仅是可被平均掉的噪声,而是提供了模型可以利用的可学习信号。  

我们的工作建立在近期观测之上,即准确的奖励模型并不总是强化学习的优秀教师(Chen等,2024)。先前工作中提出的一种假设是,除了*准确性*,RM必须在奖励空间上表现出*高方差*,以提供足够的学习信号(Razin等,2025;Yang等,2025)。我们认为重要的不是方差本身,而是*方差来自何处*。不同效用响应之间的方差是有益的,而相同效用响应之间的方差是有害的。图1展示了这一区别:盲目最大化方差(中心)会牺牲判别能力,而盲目最大化准确性(左侧)则最小化方差。右侧面板显示,精心设计的离散化可以同时优化判别能力和*特异性*(过度敏感的互补指标)。在第2.4节,我们证明在一定条件下这是可能的。在实际强化学习环境中,我们需要在没有任何先验知识的情况下估计这些离散化阈值。我们提出了一种算法,通过使用蒙特卡洛dropout(Gal和Ghahramani,2016;Gao等,2021)估计奖励模型的预测方差,并利用该方差将响应聚类成组。我们首先使用RewardBench 2的Ties子集(Malik等,2025)评估我们的算法,发现在一组流行RM上,我们一致地以适度的判别能力代价降低了奖励模型的过度敏感,从而提高了两者的平均值。然后我们模拟了一个环境,其中混合了主要奖励(指令遵循)和次要虚假(风格)奖励。直接优化这种混合会导致主要奖励被严重牺牲以优化风格,但离散化使模型能够保持主要任务的效果。最后,我们考虑了一个现实的多任务强化学习场景:在未标注提示上训练策略。比较流行奖励模型及其离散化变体在IFEval、GSM8K和MATH上的表现,离散化从未显著差于从原始奖励学习,而且通常好得多。这表明了*通过奖励聚类进行离散化*作为使用学习奖励时标准强化学习的替代方案的潜力。  

## 2 问题形式化  

### 2.1 准确性、判别能力与过度敏感  

#### 定义  
我们试图学习一个策略π:S→A。对于提示²²我们描述的情景为单次用户提示下的单轮交互,但赋予模型的状态也可以是附加完整对话上下文的提示。x∈S和响应y∈A,定义³³为了简洁,我们将使用下标表示ux(y)。“真实效用”为整数u(x,y):S×A→[mx]⊂Z。mx是一个依赖于x的随机变量,反映了给定提示x存在多少等价类(同样好的响应)。注意u(x,y)是整数值;我们明确考虑存在有限个这样的等价类的情景。这意味着效用必须是可数的(即人类能感知到的响应差异有限)和有界的(即存在“最佳可能”和“最差可能”响应的类别);我们论证这些假设是现实的(Guerdan等,2025;Elangovan等,2025)。我们的目标是学习产生最大化效用函数的响应:argmaxyu(x,y)。然而,对于给定的x,真实u未知。相反,我们可以使用一个*学习得到的奖励模型*r:S×A→R。在本文中,我们引入两个构造——*判别能力*和*特异性*——来衡量奖励模型的效果。r的*判别能力*定义为P(rx(a)>rx(b) | ux(a)>ux(b))。如果对于某个奖励模型r,该概率为1,则它在类似RewardBench 1(Lambert等,2024b)的奖励模型评估基准上将表现出完美的准确性。我们还对*特异性*感兴趣,定义为P(rx(a)=rx(b) | ux(a)=ux(b))。这是过度敏感的互补指标(James等,2013)。实际上,我们在*容忍度*ε≥0下关心这些量:奖励差距小于ε被视为不显著,并视为平局。在此容忍度下,我们将判别能力和特异性重新定义为Dr(ε):=P(rx(a)>rx(b)+ε | ux(a)>ux(b))和Specr(ε):=1−P(|rx(a)−rx(b)|>ε | ux(a)=ux(b))。这些构造比先前“奖励模型准确性”的概念更加细粒度,后者由Razin等人(2025)形式化为Ea,b∼A[1[sgn(rx(a)−rx(b))=sgn(ux(a)−ux(b))]]。  

###### 命题2.1。一个奖励的准确率是ε=0时判别能力与特异性的加权和。  

#### 证明  
准确性为Ea,b[1[sgn(rx(a)−rx(b))]=sgn(ux(a)−ux(b))]。我们在附录A中证明准确率等于:  

P[rx(a)=rx(b) | ux(a)=ux(b)] × P[ux(a)=ux(b)]  
*(特异性)*  
+ P[rx(a)>rx(b) | ux(a)>ux(b)] P[ux(a)>ux(b)]  
+ P[rx(a)<rx(b) | ux(a)<ux(b)] P[ux(a)<ux(b)]  
= 特异性 × P[效用相等] + 判别能力 × P[效用不同]。  

###### 命题2.2。假设存在一个标量函数sx(表示给定提示x下的“信号尺度”)和噪声ηx(a)满足rx(a)=sx×ux(a)+ηx(a)。如果对于所有x,a,b,ηx(a)−ηx(b)满足|ηx(a)−ηx(b)|<sx(当ux(a)>ux(b)时),则r具有完美的判别能力。  

#### 证明  
rx(a)−rx(b)=sx×(ux(a)−ux(b))+ηx(a)−ηx(b)。由于|ηx(a)−ηx(b)|<sx且ux(a)−ux(b)≥1,我们有sgn(rx(a)−rx(b))=sgn(sx×(ux(a)−ux(b))+ηx(a)−ηx(b)) > sgn(sx×(ux(a)−ux(b)))。这意味着ux(a)>ux(b) ⇒ rx(a)>rx(b),因此r具有完美的判别能力。  

###### 命题2.3。如果ηx(a),ηx(b)∼Unif(−sx/2,sx/2),那么对于任何容忍度ε∈[0,1](以sx为单位——即“效用单位”),奖励在*相邻*效用类别上的判别能力为Dr(ε)=P(rx(a)>rx(b)+ε | ux(a)=ux(b)+1)=1−ε²/2。  

#### 证明  
rx(a)−rx(b)=ηx(a)−ηx(b)+sx。则(rx(a)−rx(b))/sx = 1+ηx(a)/sx−ηx(b)/sx。由于ηx(a)/sx,ηx(b)/sx∼Unif(−1/2,1/2),则P(rx(a)−rx(b)>εsx)=P((rx(a)−rx(b))/sx>ε)=P(ηx(a)/sx−ηx(b)/sx>ε−1):=P(x−y>ε−1)其中x,y∼Unif(0,1)。由对称三角分布的CDF,P(x−y<ε−1)=((ε−1)+1)²/2=ε²/2。因此,P(rx(a)>rx(b)+εsx)=1−ε²/2。我们假设了相邻效用类别:ux(a)=ux(b)+1。这是最坏情况。当效用类别相隔更远时,P(rx(a)−rx(b)>εsx)≥P(ηx(a)/sx−ηx(b)/sx>ε−2)≥P((ηx(a)−ηx(b))/sx>−1)=1。

相似文章

奖励模型的离散化

Hugging Face Daily Papers

本文指出了连续奖励模型在强化学习中的过度敏感问题,即同等质量的回复被赋予不同的分数,并提出了一种使用蒙特卡洛dropout的离散化技术,以减少这种过度敏感,同时保持区分能力,从而得到更好的策略并减少奖励破解。