回溯优势校正:面向延迟感知RLHF的闭合形式V-Trace偏差校正

arXiv cs.LG 论文

摘要

本文介绍了Retroactive Advantage Correction (RAC),这是一种用于延迟感知RLHF的闭合形式偏差校正方法,通过将延迟奖励排队并使用V-trace风格的裁剪残差更新重新注入,来处理异步奖励信号。

arXiv:2606.27580v1 Announce Type: new 摘要:从人类反馈中进行强化学习(RLHF)在生产环境中并不总是具有同步的奖励信号。代码执行验证器、慢速评审集成和排队的人工审核可能会在产生这些信号的rollout之后若干梯度步骤才返回,从而破坏了标准PPO所依赖的同步奖励假设。为了解决这一差距,我们提出了回溯优势校正(Retroactive Advantage Correction, RAC):每个待处理的慢速完成被排队,通过一个非负核进行老化,并作为裁剪残差重新注入到下一步优化器的优势中。我们证明,在无偏裁剪重要性比率下,当有效延迟核重新注入其所有质量时,累积的RAC校正完全无偏;否则,其偏差与未重新注入的部分呈线性关系;在无延迟恒等核下,它退化为V-trace。在一个表格型马尔可夫决策过程(MDP)的概念验证中,RAC在双慢速通道配置下将闭合形式策略偏差降低了最多47.9倍,同时以更低的挂钟成本超越了等待慢速的方法。RAC通过一个两行的奖励管理器补丁与PPO和GRPO集成。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:23

# 延迟感知 RLHF 的闭式 V-Trace 偏差修正 来源: https://arxiv.org/html/2606.27580 ###### 摘要 生产环境中基于人类反馈的强化学习 \(RLHF\) 并不总能保证同步的奖励信号。代码执行验证器、慢速评审集成模型以及排队等待的人工审查,可能在产生它们制定的轨迹之后数个梯度步才返回结果,这打破了标准 PPO 所依赖的同步奖励假设。本文通过**回顾性优势修正**\(RAC\) 来应对这一挑战:每个待处理的慢速完成项被排队,通过非负老化核进行时效处理,并以裁剪后的残差形式重新注入到下一个优化步的优势函数中。我们证明,在无偏裁剪重要性比率下,当有效延迟核完全重新注入其所有质量时,累积 RAC 修正恰好无偏;否则其偏差与未重新注入的部分呈线性关系;在无延迟单位核情况下,它退化为 V-trace \(Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6)\)。在一个表格型马尔可夫决策过程 \(MDP\) 的概念验证中,在双慢速通道配置下 RAC 将闭式策略偏差降低了高达 **47.9 倍**,优于等待慢速信号的方法且壁钟成本更低。RAC 通过两行奖励管理器补丁与 PPO 和 GRPO 集成。 RLHF, 延迟感知强化学习, V-trace, 偏差修正, 离策略修正, 异步训练 ## 1 引言 ### 部署 RLHF 中的延迟奖励。 标准 PPO \(Schulman 等人, 2017 (https://arxiv.org/html/2606.27580#bib.bib22)\) 隐含地假设轨迹 \(\tau_t\) 的奖励 \(r_t\) 在优化器针对 \(\pi_\theta\) 提交下一个梯度之前就被观测到。该假设在模拟制定中成立,但在已部署的 RLHF \(Christiano 等人, 2017 (https://arxiv.org/html/2606.27580#bib.bib5); Stiennon 等人, 2020 (https://arxiv.org/html/2606.27580#bib.bib26); Ouyang 等人, 2022 (https://arxiv.org/html/2606.27580#bib.bib19)\) 中并不总是满足:代码执行验证器在产生它们制定的轨迹之后数个梯度步才返回结果 \(Jain 等人, 2024 (https://arxiv.org/html/2606.27580#bib.bib11); Li 等人, 2026 (https://arxiv.org/html/2606.27580#bib.bib15)\);速度慢但准确的 70B 评审集成模型与由快速 7B PRISM 风格评分器运行在不同的时钟上 \(Kirk 等人, 2024 (https://arxiv.org/html/2606.27580#bib.bib12)\);边缘案例的人工审查在几分钟后返回,而策略已经更新;此外,异步训练架构如 AReaL \(Fu 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib8)\) 和 Asynchronous RLHF \(Noukhovitch 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib18)\) 明确将推理工作节点与学习节点解耦,使得 \(\Delta\) 步陈旧度(其中 \(\Delta\) 是梯度步滞后)成为了一级操作参数。当慢速信号滞后 \(\Delta\) 步到达并被丢弃时,偏差会随着 \(\Delta\) 和不同慢速通道的数量 \(K\)(例如,一个代码验证器加上一个评审 RM 对应 \(K=2\))累积。¹¹ 代码: https://github.com/deadsmash07/rac-rlxf-code。 ### 离策略修正器与奖励轴。 V-trace \(Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6)\) 和 Retrace \(Munos 等人, 2016 (https://arxiv.org/html/2606.27580#bib.bib17)\) 是针对离策略值函数目标的裁剪重要性采样 \(IS\) 修正器,作用于内部评判器并解决工作节点间的角色陈旧度,而非我们目标中优化步间奖励延迟。近期的 IS 裁剪工作在 token 或回合级别收紧离策略 PPO 目标:CISPO \(Chen 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib4)\) 在保留梯度的同时裁剪每个 token 比率;Truncated PPO \(Fan 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib7)\) 将广义优势估计 \(Schulman 等人, 2016 (https://arxiv.org/html/2606.27580#bib.bib21)\) 扩展到截断制定;而 SORL \(Li 等人, 2025a (https://arxiv.org/html/2606.27580#bib.bib13)\) 增加了结合裁剪触发的归一化的回合级 IS 裁剪。2025–2026 年陈旧感知 PPO 集群 \(Zheng 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib31); Huang 等人, 2026 (https://arxiv.org/html/2606.27580#bib.bib10); Li 等人, 2025b (https://arxiv.org/html/2606.27580#bib.bib14); Xi 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib28); Lu 等人, 2026 (https://arxiv.org/html/2606.27580#bib.bib16); Sheng 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib25); Yan 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib29)\) 在 token 或序列级作用于制定轴的 IS 比率。先前的延迟奖励修正器在不同的轴上操作。RUDDER \(Arjona-Medina 等人, 2019 (https://arxiv.org/html/2606.27580#bib.bib1)\) 将一个终端情节奖励在情节内“向后”重新分布,这是一种信用分配构造;Han 等人 (2022 (https://arxiv.org/html/2606.27580#bib.bib9)) 为连续控制中的单通道延迟奖励重新表述了 \(Q\) 函数;Zhang 等人 (2023 (https://arxiv.org/html/2606.27580#bib.bib30)) 涵盖了表格型多智能体 RL 中每智能体奖励的延迟,并带有协作收敛速率保证;Ramstedt 等人 (2021 (https://arxiv.org/html/2606.27580#bib.bib20)) 针对动作延迟和观测延迟 MDP 事后重采样轨迹片段;而 AReaL \(Fu 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib8)\) 与 Asynchronous RLHF \(Noukhovitch 等人, 2025 (https://arxiv.org/html/2606.27580#bib.bib18)\) 通过限制每个推理工作节点可以漂移到何种离策略程度,经验性地限定生成陈旧度。RAC 占据了第三轴。每个在 \(\Delta\) 个优化步之后到达的慢速奖励被排队,并以加性优势修正形式重新注入到下一个优化步,权重由时效核和裁剪 IS 比率决定。跨 \(K\) 个慢速通道的这些重新注入通过一个行随机延迟核进行,使得累积偏差的期望达到闭式零(定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1)),并在单位核下恢复 V-trace 的在策略保证。 ### RAC 概览。 图 1 (https://arxiv.org/html/2606.27580#S1.F1) 示意了该机制。标准 PPO 在慢速通道返回之前提交其梯度,并丢弃残差信号。而 RAC 将迟到的慢速返回视为关于“更早”制定的证据:它将待处理的慢速完成项排队,通过非负老化核 \(w_\mathrm{age}(\Delta)\) 进行时效处理,并将慢速减去快速的残差重新注入到下一个梯度中,权重为裁剪后的 IS 比率。该裁剪是取自 V-trace \(Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6)\) 的标准离策略修正,并从值目标层面移植到优势层面。该构造是一个多通道 \(\Delta\) 步滞后累加器,受行随机延迟核约束。修正的累积偏差与有效核的行随机性松弛度呈线性关系,并在饱和情况下期望恰好为零(定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1))。在单位核 \(\Lambda=I\)(零延迟)下,定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1) 退化为 V-trace 的在策略保证,而技术贡献在于闭式多通道 \(\Delta\) 滞后扩展。 ### 贡献。 本文做出两项贡献。 - •\(C1\) 闭式累积偏差恒等式。在 V-trace 条件独立假设下,累积 RAC 修正的偏差与有效延迟核的行随机性松弛度 \(\eta\) 呈线性关系,并且在饱和核以及 V-trace 单位核下是精确的(\(\eta=0\))(定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1), Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6))。一个结合 Pinsker 不等式 \(Canonne, 2022 (https://arxiv.org/html/2606.27580#bib.bib3)\) 与 Bretagnolle–Huber 引理 \(Bretagnolle & Huber, 1979 (https://arxiv.org/html/2606.27580#bib.bib2)\) 的总变差上界(命题 2.2 (https://arxiv.org/html/2606.27580#S2.Thmtheorem2))提供了每步散度控制。 - •\(C2\) 表格型 MDP 概念验证与 7B 规模验证。在一个 \(3\times 2\) 表格型 MDP 上,在 \(K=2\) 配置下 RAC 将闭式策略偏差降低了 **47.9 倍**,且单步壁钟成本较低(表 1 (https://arxiv.org/html/2606.27580#S3.T1), 图 2 (https://arxiv.org/html/2606.27580#S3.F2))。三个机器精度 7B 规模检查证实了单位核退化、线性松弛偏差缩放以及在实际奖励分布上的 V-trace 等价性(附录 B (https://arxiv.org/html/2606.27580#A2), 附录 G (https://arxiv.org/html/2606.27580#A7))。 引用图注 图 1: 回顾性优势修正 \(RAC\) 概览。\(A\) 同步 PPO 假设奖励在下个优化步之前到达。\(B\) 当慢速通道在 \(\Delta\) 步后返回时,朴素 PPO 丢弃残差,产生的偏差与 \(\Delta\cdot K\) 成比例。\(C\) RAC 将每个待处理的慢速完成项排队,并前向注入一个裁剪、时效衰减的残差 \(\delta_i = w_\mathrm{age}(\Delta)\,\alpha\,\rho_i^{\mathrm{clip}}\,(r_i^{\mathrm{slow}}-r_i^{\mathrm{fast,bl}})\) 到下一个步的优势中;定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1) 给出了行随机核的无偏性恒等式。 ## 2 方法: 回顾性优势修正 ### 设置。 在优化步 \(t\),一个制定 \(\tau_t = (s_{t,0}, a_{t,0}, \dots, s_{t,T-1}, a_{t,T-1})\) 为每个索引 \(i\) 产生一个同步返回的*快速*奖励估计 \(r_{t,i}^{\mathrm{fast}} \in \mathbb{R}\)。一个*慢速*通道 \(k\) 在步 \(t+\Delta_k\) 返回一个验证器评级的奖励 \(r_{t,i}^{\mathrm{slow},k}\),其中 \(\Delta_k \in \{0,1,2,\ldots\}\) 是特定通道的滞后(\(\Delta_k=0\) 边界恢复同步奖励,是 V-trace 单位核情况)。快速基线 \(r_{t,i}^{\mathrm{fast,bl}}\) 可以是快速估计本身,或者是 GRPO 风格 \(Shao 等人, 2024 (https://arxiv.org/html/2606.27580#bib.bib23)\) 的留一变体。我们假设慢速残差 \(r_{t,i}^{\mathrm{slow},k} - r_{t,i}^{\mathrm{fast,bl}}\) 跨 \((t,k,i)\) 具有一致的有界方差 \(\sigma_s^2\),并且策略 KL 满足 \(\mathrm{KL}_t = \mathbb{E}[\mathrm{KL}(\pi_t \| \widetilde{\pi}_t)] < \infty\)。 ### RAC 原语。 RAC 维护一个队列 \(Q\) 用于存放待处理的慢速完成项。当 \(r_{t,i}^{\mathrm{slow},k}\) 在步 \(t+\Delta_k\) 返回时,它被前向注入到步 \(t+\Delta_k+1\) 的优势中,形式为: \[\delta_i \triangleq w_{\mathrm{age}}(\Delta_k)\,\alpha\,\rho_i^{\mathrm{clip}}\,\bigl(r_{t,i}^{\mathrm{slow},k} - r_{t,i}^{\mathrm{fast,bl}}\bigr), \tag{1}\] 其中非负老化核 \(w_{\mathrm{age}}(\Delta) \geq 0\)(定理 2.1 (https://arxiv.org/html/2606.27580#S2.Thmtheorem1) 适用于任何保持所得延迟核 \(\Lambda\) 行随机性的选择)。我们采用 \(w_{\mathrm{age}}(\Delta) = \gamma^{\Delta}\) 且 \(\gamma = \exp(-1/\tau_{\mathrm{age}})\),\(\tau_{\mathrm{age}}=1000\),在运行的 \(\Delta\) 网格上接近单位值;附录 C (https://arxiv.org/html/2606.27580#A3) 对该选择进行了消融研究(表 3 (https://arxiv.org/html/2606.27580#A3.T3))。全局增益 \(\alpha > 0\)(默认 \(\alpha=1\)),以及 V-trace 风格的裁剪重要性比率 \(\rho_i^{\mathrm{clip}} = \min(\bar{\rho}, \pi_{\theta_{t+\Delta+1}}(a_{t,i}) / \pi_{\theta_t}(a_{t,i}))\),默认 \(\bar{\rho}=1\);该裁剪将当前角色与原始生成制定的角色之间的每步比率限定在 V-trace \(Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6)\) 中使用的标准离策略修正范围内。反馈给策略梯度更新的优势为 \(\widetilde{A}_i = A_i + \delta_i\)。该修正应用于*下一个*优化步,从不修改先前已提交的梯度。当前向注入机制被禁用时,更新精确地退化为原始 PPO/GRPO。 ### 累积无偏性。 ###### 定理 2.1 (RAC 的累积偏差)。 定义有效延迟核 \[\widetilde{\Lambda}[k,\Delta] \triangleq \alpha\,w_{\mathrm{age}}(\Delta)\,\Lambda[k,\Delta],\] 其中 \(\alpha>0\) 是全局增益,\(w_{\mathrm{age}}: \mathbb{N} \to [0,1]\) 为非负老化核,\(\Lambda[k,\Delta] \in [0,1]\) 是通道 \(k\) 的奖励恰好延迟 \(\Delta \in \{0,\dots,D\}\) 个优化步的概率,\(D\) 是最大允许延迟。对于每个通道 \(k\),令 \[\eta_k \triangleq 1 - \sum_{\Delta=0}^{D} \widetilde{\Lambda}[k,\Delta] \in [0,1]\] 表示 \(\widetilde{\Lambda}\) 第 \(k\) 行的亚随机性松弛度(非负,因为 \(\alpha\,w_{\mathrm{age}}(\Delta) \leq \alpha\) 且 \(\sum_{\Delta} \Lambda[k,\Delta] \leq 1\),因此在 \(\alpha \leq 1\) 时每行之和至多为 1)。假设对于每个延迟 \(\Delta\): - •\(U\) 条件均值为一的裁剪 IS 比率。\(\mathbb{E}[\rho_{t,\Delta,i}^{\mathrm{clip}} \mid s_{t,i}, a_{t,i}] = 1\) 在行为分布下成立。这是标准的 V-trace 截断条件 \(Espeholt 等人, 2018 (https://arxiv.org/html/2606.27580#bib.bib6)\);在单位角色下严格成立,在 V-trace 裁剪和有限策略漂移下近似成立。 - •\(CI\) 条件独立。在给定 \((s_{t,i}, a_{t,i})\) 的条件下,裁剪重要性比率 \(\rho_{t,\Delta,i}^{\mathrm{clip}}\) 与慢速减去快速残差 \(r_{t,i}^{\mathrm{slow},k} - r_{t,i}^{\mathrm{fast,bl}}\)(它不依赖于 \(\Delta\))独立。 那么,对于每个通道 \(k\),累积 RAC 修正满足: \[\mathbb{E}\!\Bigl[ \textstyle\sum_{t} \delta_{t,i} \Bigr] = (1-\eta_k)\,\textstyle\sum_{t} \bigl( \mathbb{E}\, r_{t,i}^{\mathrm{slow},k} - \mathbb{E}\, r_{t,i}^{\mathrm{fast,bl}} \bigr), \tag{2}\] 其中 \(\delta_{t,i}\) 是通道 \(k\) 的重新注入修正(公式 1 (https://arxiv.org/html/2606.27580#S2.E1))。当且仅当有效行之和为 1(条件 \(R\): \(\sum_{\Delta=0}^{D} \widetilde{\Lambda}[k,\Delta] = 1\))时,该修正恰好无偏 (\(\eta_k=0\))。条件 \(R\) 在 V-trace 单位核 \(\Lambda=I\)(其中 \(w_{\mathrm{age}}(0)=1\), \(\alpha=1\))以及饱和核 \(\Lambda[k,\Delta] = \mathbb{1}\{\Delta=\bar{\Delta}_k\}\) 并在行归一化 \(\alpha = 1/w_{\mathrm{age}}(\bar{\Delta}_k)\) 下成立。

相似文章

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

基于奖励门控的CLIP选择性测试时去偏

arXiv cs.CL

介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。

LLM推理中偏差校正的自适应触发

arXiv cs.CL

本文介绍了一种用于LLM链式推理中偏差校正的自适应触发框架,利用在线变化点检测,结合白盒和黑盒信号来优化干预时机,从而提高准确性并减少干预次数。