揭示与缓解多奖励强化学习中聚合引发的奖励黑客行为

arXiv cs.CL 论文

摘要

本文在大型语言模型的多奖励强化学习中识别出聚合引发的奖励黑客行为,并提出一种自适应投影方法 AMRP,以动态调整权重,实现更好的奖励平衡和性能。

arXiv:2609.00213v1 Announce Type: new 摘要: 大型语言模型的强化学习微调越来越多地采用多个奖励维度,包括可验证规则、特定任务评估器和学习到的奖励模型,以提供跨多样能力的更丰富监督。这些维度通常以固定的聚合权重标量化。我们识别出一种失败模式,即聚合本身引发奖励黑客行为:静态投影将质上不同的奖励轮廓别名为单个标量,将优化引向最简单、最密集或系统上受奖励信号偏好的维度。在训练过程中,这使策略陷入次优轮廓,并阻止其收敛到能带来更高任务性能的更好平衡轮廓。为了解决这个问题,我们提出了自适应多奖励投影(AMRP),一种轻量级在线方法,它使用三个信号重新分配聚合权重:相对短缺、奖励波动性和近期进展,增加对滞后、不稳定或停滞维度的压力,同时缓解饱和维度。在GRPO下的结构化推理、基于引用的生成和开放式对齐中,AMRP 一致地改善了奖励轮廓平衡和下游性能,优于固定和动态加权基线;它在 GDPO 和 PPO 中也保持有效,支持跨强化学习算法的兼容性。我们的代码可在 https://github.com/yyhappier/AMRP.git 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:47

# 揭示与缓解多奖励强化学习中的聚合诱导奖励黑客行为
来源:https://arxiv.org/html/2609.00213
余源
附属机构:中国科学技术大学
附属机构:认知智能国家重点实验室
邮箱:[[email protected]](mailto:[email protected])

赵莉莉
附属机构:美团 Longcat 交互团队
邮箱:[[email protected]](mailto:)

郑广庭
附属机构:中国科学技术大学

张凯
附属机构:中国科学技术大学
附属机构:认知智能国家重点实验室

潘璐
附属机构:美团 Longcat 交互团队

曾科
附属机构:美团 Longcat 交互团队

刘琦
附属机构:中国科学技术大学
附属机构:认知智能国家重点实验室

###### 摘要
大型语言模型的强化学习微调越来越多地采用多个奖励维度,包括可验证的规则、特定任务的评估器和学习的奖励模型,以在多样化的能力上提供更丰富的监督。这些维度通常使用固定的聚合权重标量化。我们识别出一种故障模式,其中聚合本身就会诱导奖励黑客行为:静态投影将定性不同的奖励配置文件混叠为单一标量,将优化引向最容易、最密集或被奖励信号系统性青睐的那些维度。随着训练的进行,这会将策略困在次优的配置中,并阻止其收敛到能带来更高任务性能的更平衡配置。为了解决这个问题,我们提出了**自适应多奖励投影**(Adaptive Multi-Reward Projection, AMRP),这是一种轻量级的在线方法,它使用三个信号——相对不足、奖励波动性和近期进展——来重新分配聚合权重,增加对滞后、不稳定或停滞维度的压力,同时缓解饱和维度。在 GRPO 下的结构化推理、基于引用的生成以及开放式对齐中,AMRP 相较于固定和动态加权基线,始终能改善奖励配置文件平衡性和下游性能;它在 GDPO 和 PPO 下也保持有效,支持跨 RL 算法的兼容性。我们的代码可在 https://github.com/yyhappier/AMRP.git 获取。

² ² 脚注:通讯作者。

**图 1:聚合诱导的奖励黑客行为与 AMRP 在数学推理中的概述。** 奖励配置文件 $\mathbf{r}_{\mathrm{math}}=[r_{\mathrm{acc}},r_{\mathrm{fmt}},r_{\mathrm{len}}]$ 衡量答案准确性、格式合规性和长度控制。静态聚合可以通过快速改进格式和长度(同时准确性保持较低)来增加标量奖励,导致捷径策略出现。AMRP 通过在线自适应投影权重来缓解这种故障。

## 1 引言
后训练已成为使大型语言模型适应指令遵循和解决复杂任务的标准方法(Ouyang 等,2022;Guo 等,2025),许多流程现在同时优化多个奖励维度——例如,答案正确性、格式合规性和代码执行。一个常见的做法是在整个训练过程中使用固定权重将这些维度聚合成一个标量(Hayes 等,2022),这种设计简单且兼容标准的 RL 优化器,如 PPO(Schulman 等,2017)和 GRPO(Shao 等,2024)。然而,这种投影是有损的:定性不同的奖励配置可以产生相同的标量,掩盖了实际驱动学习的维度。我们将这种故障模式称为**奖励配置崩溃**。它始于**配置混叠**:静态聚合可以将定性不同的奖励配置映射到相同的标量值。例如,在相等的权重下,$[1,0,0]$ 和 $[0,1,0]$ 在标量化后变得无法区分。这种混叠随后可能导致**捷径锁定**(Geirhos 等,2020):容易或密集的维度在早期标量奖励改进中占主导地位,而较难的维度则优化不足。在数学推理中,如图 1 所示,格式和长度奖励比答案正确性提供更快和更密集的反馈,因此策略首先学会满足表面约束,同时仍然无法完成任务。一旦此类捷径配置在策略滚动中占据主导地位,被忽略维度的信息样本会减少,将其困在标量化目标下的局部最优中,使得后期的恢复变得困难,并最终阻止策略达到能带来更高任务性能的更平衡配置。与传统的奖励黑客行为(Skalse 等,2022;Gao 等,2023a)不同,这种故障不需要任何奖励维度无效——即使所有维度都是有意义的,仅静态聚合就能制造陷阱。我们将此现象称为**聚合诱导的奖励黑客行为**。为了解决这个问题,我们提出了**自适应多奖励投影**(Adaptive Multi-Reward Projection, AMRP),一种简单但有效的聚合方法,以缓解这种奖励配置崩溃。AMRP 不是在整个训练过程中使用固定权重向量投影奖励配置,而是根据观察到的每个奖励维度的动态在线自适应投影。具体来说,我们引入了三个信号:相对不足、奖励波动性和近期进展。相对不足衡量一个维度是否落后于其他维度。奖励波动性衡量一个维度是否仍然不稳定。近期进展衡量一个维度是在改进、停滞还是退步。AMRP 增加了那些滞后、不稳定或停滞维度的权重,降低了那些已经饱和且稳定的维度的权重。通过这种方式,我们的方法有效缓解了奖励配置崩溃。我们在三个不同的多奖励设置中评估了 AMRP:基于规则的数学推理、带有自动评估器的基于引用的生成,以及带有学习奖励模型分数的开放式对齐。AMRP 一致地改善了下游性能和奖励配置动态,在数学推理和基于引用的生成中获得特别大的收益,并在相关性更强的开放式设置中获得一致收益。我们进一步证明了 AMRP 能够与 GDPO 和 PPO 有效组合,并且在测试的超参数范围内保持鲁棒。我们的贡献可总结如下:
- • 我们识别出**奖励配置崩溃**作为多奖励强化学习中聚合诱导奖励黑客行为的一种模式,源于配置混叠和捷径锁定。
- • 我们提出了**自适应多奖励投影**,一种动态聚合方法,根据三个信号(相对不足、奖励波动性和近期进展)在线自适应奖励投影。
- • 我们在多种骨干模型上验证了 AMRP 在结构化推理、基于引用的生成和开放式对齐中的效果,显示出一致的下游收益以及与 GRPO、GDPO 和 PPO 的兼容性。

**图 2:数学推理中静态加权下的奖励配置崩溃。** (a) 标量奖励增加,而答案准确性下降,由格式和长度奖励饱和驱动。(b) 捷径配置 $(r_{\mathrm{acc}}=0,r_{\mathrm{fmt}}=1,r_{\mathrm{len}}=1)$ 迅速占据主导地位。(c) 平均响应长度急剧下降,与短的格式合规捷径策略一致。

## 2 相关工作
#### 奖励黑客行为与过度优化。
奖励黑客行为发生在优化不完美的代理奖励会损害真实目标上的性能时(Skalse 等,2022)。它与捷径学习密切相关,模型利用虚假特征而非期望的解决方案(Geirhos 等,2020;Yuan 等,2024)。在 RLHF 中,对学习奖励模型的强优化可能导致过度优化或古德哈特定律效应(Gao 等,2023a;Coste 等,2023)。现有的缓解措施包括约束优化(Moskovitz 等,2024;Ackermann 等,2026)、奖励集成(Coste 等,2023;Ramé 等,2024)、去偏奖励学习(Chen 等,2024;Miao 等,2024)和奖励转换(Fu 等,2025)。我们的工作研究了由聚合本身引起的互补故障:静态标量化会掩盖维度间的信号,并将优化引向更容易或更密集的维度,即使每个奖励都是有意义的。

#### 多维奖励。
现代 LLM 后训练结合了异构的奖励来源。RLVR 使用确定性或程序性反馈,如答案验证、代码执行和格式约束(Shao 等,2024;Le 等,2022)。基于引用的生成使用自动评估器来评估正确性、引用质量和流畅性,例如 ALCE(Gao 等,2023b)。开放式对齐通常依赖于多属性奖励数据或学习的多目标奖励模型,如 HelpSteer2(Wang 等,2024b)和 ArmoRM(Wang 等,2024a)。LLM-as-a-judge 评估实现了可扩展的评估,但可能引入位置或冗长偏好等偏差(Zheng 等,2023)。当在 RL 中联合优化多个维度时,它们通常在策略优化之前进行标量化。

#### 多奖励聚合。
由于响应质量是多维的,多奖励优化通常使用固定的加权和对奖励进行标量化,即从奖励配置到标量信号的静态投影。当维度在密度、方差、尺度或难度上不同时,这种投影可能丢弃与学习相关的信息。DRBO 使用基于奖励水平或近期奖励变化的单统计量规则动态重新分配奖励权重(Chen 等,2025)。而 GDPO 则通过维度级奖励归一化来提高 GRPO 的信号分辨率(Liu 等,2026)。我们的工作针对聚合诱导的奖励黑客行为,其中静态聚合混叠奖励配置,即使在奖励有效时也会诱导捷径锁定。AMRP 将不足、波动性和进展信号结合作为软连接,并使用 EMA 平滑以保持稳定。因此,它不同于 DRBO 风格的单统计量重新加权,并补充了 GDPO 风格的归一化。

## 3 聚合诱导的奖励黑客行为
本节形式化了奖励聚合本身如何诱导奖励黑客行为。我们将静态聚合视为从多维奖励配置到标量训练信号的投影。虽然计算上简单,但这种投影丢弃了维度信息,导致**配置混叠**(不同配置变得无法区分)和**捷径锁定**(优化利用容易的维度,同时削弱较难维度的信号)。随后我们从结构化推理实验中提供诊断证据。

### 3.1 静态聚合作为投影
我们考虑用于 LLM 后训练的多奖励强化学习。给定提示 $x \sim \mathcal{D}$,策略 $\pi_\theta$ 生成响应 $y \sim \pi_\theta(\cdot|x)$,该响应由 $K$ 个奖励维度评估:$\mathbf{r}(x,y)=[r_1(x,y),\ldots,r_K(x,y)]$。(1) 每个维度衡量响应质量的一个方面(例如,正确性、格式或长度)。一个常见的做法是将奖励配置聚合为一个标量奖励:$R_{\mathbf{w}}(x,y)=\sum_{i=1}^{K}w_ir_i(x,y)$,(2) 其中权重 $w_i \geq 0$ 且 $\frac{1}{K}\sum_i w_i=1$。这种聚合将 $K$ 维奖励配置映射到一维信号。一旦 $R_{\mathbf{w}}$ 用于 RL 训练目标,策略更新就由标量化奖励而非完整奖励配置驱动,并且奖励维度之间的区别不再直接对学习算法可见。例如,在 GRPO 中,来自同一提示的一组滚动 $\{y_j\}_{j=1}^G$ 被转换为组相对优势:$\hat{A}_j=\frac{R_{\mathbf{w}}(x,y_j)-\operatorname{mean}_k R_{\mathbf{w}}(x,y_k)}{\operatorname{std}_k R_{\mathbf{w}}(x,y_k)+\epsilon}$。(3) 因此,投影权重 $\mathbf{w}$ 决定了每个滚动组内的标量奖励差距,进而决定了用于策略更新的相对优势。结果,诱导相同标量化值的不同奖励配置在训练期间被同等对待,即使它们反映了定性不同的行为。

### 3.2 奖励配置崩溃
我们将**奖励配置崩溃**定义为由静态奖励聚合引起的维度学习信息的损失。因为在策略更新期间只有标量化奖励是可见的,不同的配置可能变得无法区分,将学习偏向更容易的维度。

#### 配置混叠。
静态聚合可以将不同的奖励配置映射到相同或相似的标量值。例如,在静态权重 $\{1,1,1\}$ 下,不同的奖励配置 $[1,0,0], [0,1,0], [0,0,1]$ 被投影到相同的标量奖励,尽管它们对应非常不同的情况。在数学推理中,这些可能分别对应:一个正确但格式不佳的答案、一个格式正确但不正确的答案,以及一个仅满足长度约束的响应。标量化后,维度间的差异对策略更新不可见。

#### 捷径锁定。
这种损失在训练过程中会累积。在训练早期,容易或密集的维度比困难或稀疏的维度改进得更快。例如,一个策略可能在学会答案正确性之前先学会格式和长度合规,从而向实现高标量奖励但未解决问题的捷径配置移动。一旦这些配置在滚动中占据主导地位,较难的维度可能在滚动组内变得稀疏或低对比度,使得组相对优势难以强化所需行为。配置混叠和捷径锁定共同导致了**聚合诱导的奖励黑客行为**:策略可以通过利用容易、密集或奖励模型偏好的维度来增加标量奖励,而不是改进完整的奖励配置。此类捷径配置在标量化

相似文章

强化学习中的多模态奖励破解

arXiv cs.AI

本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。

基于评分标准的强化学习中的奖励黑客问题

Hugging Face Daily Papers

本文研究了基于评分标准的强化学习中的奖励黑客现象,分析了训练验证器与评估指标之间的分歧。文章提出了一种针对“自我内化差距”的诊断方法,并证明更强的验证能力虽然能减少但无法完全消除奖励黑客问题。