面向人类反馈强化学习的元学习奖励塑造
摘要
MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。
arXiv:2607.26094v1 Announce Type: new
摘要:从人类反馈中进行强化学习(RLHF)是使大型语言模型与人类偏好对齐的标准方法,但它的质量受限于静态的、任务无关的奖励模型。这种不匹配导致学习信号稀疏和对齐效果欠佳。我们提出了 MeRLa(元学习奖励塑造),一个原理性框架,它在 RLHF 训练之前,通过辅助任务元学习一个任务感知的塑造函数 $\Phi(x,y;\phi)$。学习到的塑造产生一种复合奖励,既能保持策略的最优性,又能提供任务特定的学习信号。我们的元目标结合了任务判别、熵正则化和基于势的守恒,以实现稳定收敛。我们提供了策略不变性的理论保证,分析了表示漂移敏感性,并正式解决了来自熵最大化的激励错位问题。在 LLaMA-3-8B 上跨四个基准的实验显示,相较于 PPO、DPO、GRPO 和 DAPO,MeRLa 取得了持续改进,在 AlpacaEval 2.0 上实现了 90.8% 的长度受控胜率,在 MT-Bench 上得分为 9.14,训练不稳定性降低了 41%。MeRLa 在与基于过程和基于评分标准的增强奖励结合时仍能保持其优势。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 元学习奖励塑形:用于人类反馈强化学习
来源:https://arxiv.org/html/2607.26094
###### 摘要
人类反馈强化学习(RLHF)是将大型语言模型与人类偏好对齐的标准方法,但其质量受限于静态、任务无关的奖励模型。这种不匹配导致学习信号稀疏和对齐效果欠佳。我们提出 MeRLa(元学习奖励塑形),一个原则性的框架,在 RLHF 训练之前通过辅助任务元学习一个任务感知的塑形函数 Φ(x,y;φ)。学习到的塑形生成一个复合奖励,在保持策略最优性的同时提供任务特定的学习信号。我们的元目标结合了任务区分、熵正则化和基于势的守恒,以实现稳定收敛。我们提供了策略不变性的理论保证,分析了表示漂移敏感性,并正式解决了由熵最大化导致的激励错位问题。在 LLaMA-3-8B 上进行的四个基准实验表明,MeRLa 相比 PPO、DPO、GRPO 和 DAPO 一致提升——在 AlpacaEval 2.0 上达到 90.8% 的长度控制胜率,在 MT-Bench 上达到 9.14,训练不稳定度降低 41%。MeRLa 在与基于过程和基于评分标准的增强奖励结合时仍能保持其优势。
## 引言
人类反馈强化学习(RLHF)是后训练对齐的基石(Ouyang et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib1); Bai et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib2))。标准流程首先在成对偏好数据上训练奖励模型 R_ψ(Wang et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib6); Gao et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib7)),然后通过 PPO(Schulman et al. 2017 (https://arxiv.org/html/2607.26094#bib.bib3))、GRPO(Shao et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib4))或 DPO(Rafailov et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib16))优化策略。尽管取得了成功,这一范式面临着有据可查的局限性。奖励模型训练于静态、任务无关的偏好数据,为涵盖推理、创造力、安全性和事实准确性的多样化提示提供固定信号(Wang et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib6); Gao et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib7); Casper et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib8))。这导致:(1) 奖励稀疏——细微的质量差异获得近乎相同的分数;(2) 过度优化——策略利用奖励模型的盲点;(3) 对齐税——在狭窄信号上的过度优化损害了通用能力(Casper et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib8))。
### 奖励塑形:前景与风险
奖励塑形通过辅助项增强基础奖励以指导学习,在 RL 中具有深厚的理论基础(Ng et al. 1999 (https://arxiv.org/html/2607.26094#bib.bib9))。基于势的塑形保持最优策略,并能提高学习效率。然而,为 LLM 设计塑形函数具有挑战性:手动工程需要每个任务的专业知识(Zou et al. 2019 (https://arxiv.org/html/2607.26094#bib.bib10)),而学习到的塑形函数(包括自适应方法 Ma et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib11))必须仔细约束,因为非基于势的塑形可能改变诱导的最优策略(Ng et al. 1999 (https://arxiv.org/html/2607.26094#bib.bib9))。自我奖励模型(Yuan et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib12))和 AI 生成奖励(Lee et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib14); Xie et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib15))部分解决了这一问题,但依赖于可能有缺陷的自我判断或昂贵的推理。
### 我们的贡献
我们提出 MeRLa,一个在 RLHF 训练之前元学习奖励塑形函数 Φ(x,y;φ) 的框架。关键洞察是,跨辅助任务的经验为学习什么构成好的奖励提供了丰富信号,无需额外的人类标注。我们的贡献:
- 提出一个用于 RLHF 奖励塑形的元学习公式,通过基于势的约束保持策略最优性(§4.1)。
- 提出一个组合元目标,平衡任务区分、熵正则化和塑形守恒(§4.2)。
- 对表示漂移敏感性(§5.2)和由熵最大化导致的激励错位(§5.3)进行理论分析。
- 在 LLaMA-3-8B 上进行的广泛实验表明,在四个基准上相比 PPO、DPO、GRPO 和 DAPO 一致提升,同时与增强基础奖励的消融实验(§6.2,§6.5)。
- 分析显示奖励方差降低 37%,训练不稳定度降低 41%,同时保持生成多样性(§7.3)。
## 相关工作
### RLHF 与偏好优化
标准 RLHF 流程在成对偏好上训练奖励模型,然后通过 PPO 优化策略(Schulman et al. 2017 (https://arxiv.org/html/2607.26094#bib.bib3); Ouyang et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib1))。最近的替代方案包括 DPO(Rafailov et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib16))(绕过奖励模型)、GRPO(Shao et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib4))(组相对基线)、DAPO(Yu et al. 2025 (https://arxiv.org/html/2607.26094#bib.bib5))(解耦裁剪)、RLOO(Ahmadian et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib17))(带在线基线的 REINFORCE)和 SimPO(Meng et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib18))(无参考奖励)。所有这些都基于固定的奖励信号;MeRLa 通过学习塑形该信号来补充它们。
### 强化学习中的奖励塑形
基于势的奖励塑形保证策略不变性(Ng et al. 1999 (https://arxiv.org/html/2607.26094#bib.bib9))。先前的工作探索了元学习塑形(Zou et al. 2019 (https://arxiv.org/html/2607.26094#bib.bib10))、自适应塑形(Ma et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib11))、Text2Reward(Xie et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib15))和自我奖励模型(Yuan et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib12))。MeRLa 的不同之处在于,在 LLM 输入-输出空间上元学习一个连续的塑形函数,具有正式的策略保持和表示漂移分析。
### 过程与增强奖励模型
过程奖励模型为推理提供步骤级反馈(Lightman et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib24); Uesato et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib25));Shepherd(Wang et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib26))训练一个批评家用于错误检测。RewardBench(Lambert et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib28))和 WARM(Ramé et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib29))改进了评估和鲁棒性。MeRLa 是互补的:它增强任何基础奖励信号,包括基于过程和基于评分标准的奖励(§6.5)。
### 语言模型的元学习
元学习已应用于上下文学习(Min et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib19))和少样本适应,但其在 RLHF 奖励设计中的使用仍未充分探索。我们将奖励塑形表述为一个双层优化问题:内循环在单个任务上执行 RLHF,外循环跨任务优化塑形函数。
### 微调中的表示稳定性
微调可能会扭曲预训练表示并降低 OOD 性能(Kumar et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib27)),这对于策略不断演变的 RLHF 尤其相关。我们通过为塑形网络使用冻结编码器来解决这一问题,并提供理论漂移界限(§5.2)。
## 预备知识
#### 语言模型作为策略。我们将参数为 θ 的自回归语言模型视为随机策略 π_θ(y|x) = Π_{t=1}^{|y|} π_θ(y_t | x, y_{<t}),其中 y 是响应 token 序列。
#### 偏好建模。Bradley-Terry 模型假设偏好概率 P(y_1 ≻ y_2 | x) = σ(r(x, y_1) - r(x, y_2)),其中 r(x, y) 是潜在奖励。
#### 奖励塑形。给定一个基础奖励 R(x, y),塑形后的奖励为 R̂(x, y) = R(x, y) + Φ(x, y; φ),其中 Φ 是塑形函数。如果 Φ 具有势能形式 Φ(x, y) = γ Ψ(x, y) - Ψ(x, y') 对于某个势函数 Ψ,则最优策略保持不变。
## MeRLa 框架
### 元学习公式
我们给定一组辅助任务 T = {τ_i},每个任务有自己的提示分布和偏好数据。元学习目标:学习塑形函数 Φ(·; φ),使得每个任务上的 RLHF 训练更高效、更对齐。内循环:对于每个任务 τ_i,使用塑形后的奖励 R̂_i = R + Φ 更新策略。外循环:优化 φ 以最大化跨任务的平均对齐奖励。
#### 形式定义。令 L_RLHF(τ_i; φ) 为在使用塑形函数 φ 的奖励下策略在任务 τ_i 上的预期 KL 惩罚奖励。元目标:max_φ E_{τ_i}[L_RLHF(τ_i; φ)]。
### 元目标
我们的元目标由三个部分组成:
L_meta(φ) = L_task(φ) + λ_1 L_ent(φ) + λ_2 L_con(φ) (5)
其中 L_task 是任务区分损失,L_ent 是熵正则化项,L_con 是势基守恒损失。
#### 任务区分损失。L_task = E_{τ_i}[log P(τ_i | R̂_i)],鼓励塑形后的奖励反映任务身份。
#### 熵正则化损失。L_ent = H(R̂_i),其中 H 是跨批的奖励分布熵,促进多样化的奖励信号。
#### 势基守恒损失。L_con = ||Φ - γΨ + Ψ'||^2,强制 Φ 近似为势能形式。
## 理论分析
### 策略不变性
我们证明如果 L_con = 0,则塑形后的奖励诱导的策略与原始奖励的策略相同。
#### 命题 1(策略不变性)。如果 Φ 是精确的势能塑形,则最优策略 π* 保持不变。
### 表示漂移敏感性
我们分析在微调期间如果编码器更新,塑形函数的输出如何漂移。令 h 为隐藏表示。则 ||Φ(h + δ) - Φ(h)|| ≤ L_φ ||δ||,其中 L_φ 是塑形函数的 Lipschitz 常数。微调期间表示漂移 ||h^{(t)} - h^{(0)}|| 随时间增长。先前的工作已经证明微调会扭曲预训练表示(Kumar et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib27)),而 SGD 诱导的表示漂移可能表现出类似扩散的动态,均方位移为 O(√t) 在扩散状态下(Pashakhanloo and Koulakov 2023 (https://arxiv.org/html/2607.26094#bib.bib36))。为了进一步控制 Lipschitz 常数,我们对塑形 MLP 应用谱归一化,强制 L ≤ L_max。我们还添加一个辅助 Lipschitz 正则化项:L_drift = E[||∇_φ Φ||_F^2], L_φ ≤ L_max (12)
#### 经验验证。使用冻结编码器时,在 1000 个训练步中塑形输出的方差为 0.002(可忽略)。使用更新中的编码器时,方差为 0.087——增加了 43 倍。最终的 AlpacaEval 2.0 胜率从 90.8%(冻结)下降到 87.1%(更新中),证实冻结编码器对于稳定塑形至关重要。冻结编码器不增加额外内存成本,因为标准 RLHF 中已经维护了参考模型用于 KL 惩罚计算。
### 熵与激励对齐
一个自然的担忧是,最大化塑形奖励分布的熵是否可能引入激励错位——熵项是否会鼓励塑形函数产生偏离真实质量排序的奖励信号?我们正式解决这一问题。
###### 命题 2(激励对齐界限)。令 Δ_incentive 表示由于塑形函数导致的最优策略动作排名的最大变化。则:
Δ_incentive ≤ α·(L_con(φ) + ε_pb) (13)
其中 ε_pb = ||Φ - Φ^*|| 是残差守恒损失。 (13)
该界限表明激励错位由两个因素控制:(1) 塑形强度 α,以及 (2) 与势能形式的偏差。由于熵损失 L_ent 与 L_con 联合优化,守恒损失充当正则化器,防止熵最大化扭曲奖励分布。
#### 关键见解。熵项鼓励奖励分布丰富性(在批次内分散奖励值)而不是奖励幅度膨胀。因为熵是在批次内分布 p(R̂(x,y;φ)) 上计算的,它不能增加任何单个响应的奖励而不相应调整其他响应。然后守恒损失确保这些调整保持近似势能形式,保护最优策略排序。
#### 防止退化解决方案的安全措施。三种机制防止激励错位:(1) 守恒损失 L_con 将 Φ 约束到势能子空间;(2) KL 惩罚 β KL(π_θ || π_ref) 提供对奖励黑客的二次检查;(3) 任务区分损失 L_task 确保塑形后的奖励保持基础奖励的任务质量排序。在我们的实验(§7.3)中,我们验证了 MeRLa 训练的策略不表现出奖励黑客行为:n-gram 多样性增加 23%,GPT-4 判断分数在所有维度(包括诚实性和安全性)上均有所提高。
## 实验
### 实验设置
#### 基础模型。我们使用 LLaMA-3-8B-Instruct(Grattafiori et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib20))作为基础策略。奖励模型在 UltraFeedback(Cui et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib13))上训练,遵循 Ouyang et al. (2022 (https://arxiv.org/html/2607.26094#bib.bib1))的方法,采用 LoRA(Hu et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib21))(秩 16)。
#### 基线。我们比较:(1) 仅 SFT,(2) PPO(Schulman et al. 2017 (https://arxiv.org/html/2607.26094#bib.bib3); Ouyang et al. 2022 (https://arxiv.org/html/2607.26094#bib.bib1)),(3) DPO(Rafailov et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib16)),(4) GRPO(Shao et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib4)),(5) DAPO(Yu et al. 2025 (https://arxiv.org/html/2607.26094#bib.bib5))。所有方法共享相同的基础模型和偏好数据。需要显式奖励模型的方法使用相同的奖励模型检查点。
#### 评估基准。我们在以下基准上评估:(1) AlpacaEval 2.0(Dubois et al. 2024 (https://arxiv.org/html/2607.26094#bib.bib22))用于指令遵循;(2) MT-Bench(Zheng et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib23))用于多轮对话;(3) MATH(Hendrycks et al. 2021 (https://arxiv.org/html/2607.26094#bib.bib34))用于数学推理;(4) IFEval(Zhou et al. 2023 (https://arxiv.org/html/2607.26094#bib.bib31))用于可验证的指令遵循准确性。
#### AlpacaEval 2.0 协议。我们报告使用 GPT-4-Turbo 作为判断器、标准贪婪模板(温度=0)的长度控制(LC)胜率。响应通过贪婪解码生成(max_tokens=2048)。结果在 3 次不同种子的运行中取平均。
#### 实现细节。塑形网络是一个 2 层 MLP(隐藏维度 256,SiLU 激活,谱归一化)。我们设置 M=64 个元任务,α=0.3,λ_1=0.05,λ_2=0.1。RLHF 使用 GRPO(组大小 8,β=0.004,学习率 10^{-6},20 个 epoch)在 8×A100-80GB GPU 上运行。
### 主要结果
表 1 (https://arxiv.org/html/2607.26094#Sx6.T1) 总结了主要结果。MeRLa(GRPO 骨干)在 AlpacaEval 2.0 上达到 90.8% 的 LC 胜率,比 DAPO 高出 3.9 个百分点。所有基准上一致增益:MT-Bench 提高 0.33,MATH 提高 5.6%,IFEval 提高 3.9%,均具有统计显著性(p < 0.05,配对 t 检验)。
表 1: LLaMA-3-8B 上的主要结果。† 表示我们的重新实现。所有数字为 3 次运行的平均值。AlpacaEval 2.0 报告 LC 胜率:95% 置信区间在 ±1.2% 以内。
图 2 (https://arxiv.org/html/2607.26094#Sx6.F2) (a) 比较了各方法在基准上的性能,(b) 以雷达图形式绘制了多维分数。MeRLa 在所有六个维度上优于所有基线,在推理(+5% vs DAPO)和安全性(+9% vs DAPO)方面具有明显优势。这表明我们的元学习塑形函数在传统奖励模型的薄弱点上提供了优越的监督。
图 2: (a) 柱状图比较四种基准上的方法。(b) 从 GPT-4 评估得到的各维度分数雷达图。MeRLa(红色)在所有维度上占主导地位。
### 消融研究
#### 元任务数量扩展。图 3 (https://arxiv.org/html/2607.26094#Sx6.F3) (a) 显示性能如何随元任务数量 M 扩展。MeRLa 在所有 M 值上均持续优于 DAPO。差距随着 M 增大而扩大,在 M=64 附近趋于平稳。这表明元任务分布中的多样性至关重要——更多任务提供更丰富的学习信号。
#### 组件分析。图 3 (https://arxiv.org/html/2607.26094#Sx6.F3) (b) 消融了元目标的每个组件(等式 5)。移除 L_task 导致最大降幅(约 3.7%),证实了其核心作用。移除 L_ent 和 L_con 也有显著影响。相似文章
通过改变理性度来缓解RLHF中的认知偏差
本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。
LEMUR:从偏好反馈中学习与多目标强化学习对齐
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
对齐篡改:人类反馈强化学习如何被利用来优化失调偏见
本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。
基于自适应奖励塑造和策略比率重加权策略的高样本效率迁移强化学习
本文提出了一种用于自动驾驶高速公路车道变换的安全迁移强化学习框架,采用自适应教师干预和奖励塑造来提高样本效率和安全性。实验表明,与基线相比,安全性提升超过52%,效率提升5%。