S2T-RLHF:面向稳定偏好型RLHF的分层信用分配
摘要
S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。
arXiv:2607.18258v1 Announce Type: new
Abstract: 基于人类反馈的强化学习(RLHF)结合偏好型奖励模型常常表现出不稳定的训练动态。一个关键因素在于标准RLHF依赖单一的序列级标量奖励,该奖励被传播到令牌级策略更新中,导致响应内部的信用分配固有地模糊不清。近期工作尝试通过将奖励细化为更密集的令牌级监督来解决这一问题,通常默认更细粒度的信用分配能改善优化。我们认为这一假设并不完整:当偏好信号存在噪声且仅在响应级别定义时,过于细粒度的奖励细化会放大奖励不确定性并破坏学习稳定性。为了解决这个问题,我们提出了一种粒度感知原则用于分层信用分配,强调以稳定性为导向的奖励设计而非最大化分配精度。在此原则下,句子作为一种自然的中间粒度,在语义连贯性与对令牌级噪声的鲁棒性之间取得平衡。基于这一观点,我们引入了S2T-RLHF。这种句子到令牌的奖励分解框架首先将序列级偏好奖励分配到各个句子,然后在每个句子内部应用有界令牌级细化,无需重新训练奖励模型或使用令牌级监督。跨多个数据集和优化设置的实验表明,S2T-RLHF在保持竞争性偏好对齐的同时,提高了训练稳定性和鲁棒性。
查看缓存全文
缓存时间: 2026/07/22 08:20
# S2T-RLHF:用于稳定基于偏好的RLHF的分层信用分配
来源:https://arxiv.org/html/2607.18258
Wei Chen¹,Guanghui Zhu¹,Yafei Li²,Limin Wang¹,Yihua Huang¹
¹南京大学计算机软件新技术国家重点实验室
²郑州大学计算机科学与人工智能学院
ischenwei@outlook\.com, zgh@nju\.edu\.cn, ieyfli@zzu\.edu\.cn, lmwang@nju\.edu\.cn, yhuang@nju\.edu\.cn
###### 摘要
基于人类反馈的强化学习(RLHF)与基于偏好的奖励模型通常表现出不稳定的训练动态。一个关键因素是,标准RLHF依赖于单一的序列级标量奖励,该奖励被传播到令牌级的策略更新,使得响应内部的信用分配本质上不明确。最近的工作试图通过将奖励细化为更密集的令牌级监督来解决这个问题,通常依赖于一个隐含假设:更细粒度的信用分配能改善优化。我们认为这一假设是不完整的:当偏好信号有噪声且仅在响应级别定义时,过度细粒度的奖励细化会放大奖励的不确定性并破坏学习的稳定性。为了解决这个问题,我们提出了一个粒度感知的分层信用分配原则,强调以稳定性为导向的奖励设计,而非追求最大化的分配精度。在该原则下,句子作为自然的中间粒度,在语义连贯性与对令牌级噪声的鲁棒性之间取得平衡。基于这一观点,我们引入了S2T-RLHF。这个从句子到令牌的奖励分解框架首先将序列级的偏好奖励分配到句子之间,然后在每个句子内部进行有界的令牌级细化,无需重新训练奖励模型或使用令牌级监督。在多个数据集和优化设置下的实验表明,S2T-RLHF在保持有竞争力的偏好对齐的同时,提升了训练的稳定性和鲁棒性。
## 1 引言
基于人类反馈的强化学习(RLHF)已成为大型语言模型(LLM)基于偏好的对齐的核心范式,在帮助性、无害性和人类偏好对齐方面取得了显著改进[8 (https://arxiv.org/html/2607.18258#bib.bib17),45 (https://arxiv.org/html/2607.18258#bib.bib2),25 (https://arxiv.org/html/2607.18258#bib.bib3),31 (https://arxiv.org/html/2607.18258#bib.bib47)]。尽管经验上成功,RLHF在长程语言生成中常常表现出明显的不稳定性。常见的病态包括长度偏差、奖励集中以及偶尔的奖励崩溃[6 (https://arxiv.org/html/2607.18258#bib.bib43),21 (https://arxiv.org/html/2607.18258#bib.bib44),38 (https://arxiv.org/html/2607.18258#bib.bib45),20 (https://arxiv.org/html/2607.18258#bib.bib46)]。这些问题即使在仔细的超参数调整和正则化下仍然存在,表明其根本原因超出了实现细节。
标准RLHF流程的一个关键限制在于其奖励公式。学习的奖励模型为整个生成的响应分配一个单一的标量分数,仅在序列级别提供监督。虽然这对于优化全局偏好有效,但这种标量反馈对于如何在长生成轨迹内分配信用没有任何指导[43 (https://arxiv.org/html/2607.18258#bib.bib10)]。因此,强化学习必须将一个全局的偏好信号传播到许多解码步骤中,通常导致高方差的梯度、不稳定的策略更新以及对细粒度生成行为有限的可控性。
我们观察到,许多这些失败源于语言的语义粒度与奖励分配和优化的粒度之间的结构不匹配。其核心反映了人类偏好的表达方式与语言模型生成文本方式之间的紧张关系。人类评估者通常通过句子或语义单元来判断响应,例如一个主张是否正确、指令是否被遵循、拒绝是否恰当、语气是否安全且有帮助。相比之下,LLM生成离散的令牌,这些令牌的孤立贡献是亚符号且上下文相关的,通常在其周围的语言结构之外缺乏可解释的意义。因此,直接从序列级的标量中推导出令牌级的奖励是不适定的。全局得分将句子级的语义质量与令牌级的实现纠缠在一起,使得细粒度的信用分配本质上模糊且不稳定。
最近的工作[19 (https://arxiv.org/html/2607.18258#bib.bib13),37 (https://arxiv.org/html/2607.18258#bib.bib11)] 主要将RLHF的不稳定性视为监督不够密集的问题,从而推动了越来越详细的令牌级信用分配方法。这一系列工作通常隐含地假设更细粒度的信用分配对优化固有地有益。然而,这一假设将精度与稳定性混为一谈。当偏好信号有噪声且仅在响应级别定义时,将奖励细化到超出偏好表达语义分辨率的地步,会放大奖励的不确定性,传播来自奖励模型的局部伪影,并破坏学习动态而非改善它。因此,我们建议,稳定RLHF并不依赖于追求最大化的信用分配分辨率,而是依赖于设计奖励信号,使其粒度与语言的语义结构对齐。从这个角度看,奖励分解应优先考虑支持稳定优化的语义上有意义的单元,而非最大化分配精度。这种粒度感知的视角将RLHF中的密集奖励设计重新定义为语义对齐和学习稳定性的问题,而不仅仅是信用分配精度的问题。
为了落实这一视角,我们采用了一种尊重语言语义结构的分层信用分配观点。我们并不将密集奖励设计视为对令牌的平坦分配问题,而是强调信用分配应反映自然语言的内在层次结构:句子表达连贯的语义意图,而令牌则通过词汇和句法选择来细化这一意图。基于这一原则,我们提出了从句子到令牌的RLHF(S2T-RLHF),这是用于稳定基于偏好的RLHF的分层信用分配的一个具体实例。S2T-RLHF首先通过一个结构化的协作分配机制将序列级的偏好奖励分配到语义稳定的句子级单元上,然后在每个句子内部进行有界的令牌级细化。该方法仅使用序列级的偏好奖励,无需重新训练奖励模型或使用令牌级监督。重要的是,S2T-RLHF并非该原则的唯一可能实现,而是以稳定性为导向的分层信用分配的一个简单且实用的实例。我们还在附录D (https://arxiv.org/html/2607.18258#A4) 和 E (https://arxiv.org/html/2607.18258#A5) 中提供了理论讨论,分析了序列级奖励如何导致全局优势对齐、长程方差放大和长度相关的梯度缩放,以及两阶段的S2T设计如何缓解这些影响。
我们总结主要贡献如下:
∙ 我们提出了一个RLHF的信用分配设计原则,强调训练稳定性应通过将奖励粒度与语言的语义结构对齐来实现,而非追求越来越细粒度的信用分配。
∙ 在该原则指导下,我们开发了S2T-RLHF,一种分层语义信用分配方法,它将序列级的偏好信号分解为句子级分配,随后进行令牌级细化,从而在无需额外标注或重新训练奖励模型的情况下实现密集且语义上有依据的监督。
∙ 我们通过多个数据集和优化设置对S2T-RLHF进行了实证评估,表明分层信用分配在保持与现有信用分配方法有竞争力的偏好对齐的同时,提升了训练的稳定性和鲁棒性。
## 2 相关工作
##### 大型语言模型与偏好对齐。在大规模语料库上预训练的大型语言模型在指令跟随和开放域生成方面取得了强劲性能[26 (https://arxiv.org/html/2607.18258#bib.bib14),4 (https://arxiv.org/html/2607.18258#bib.bib15),35 (https://arxiv.org/html/2607.18258#bib.bib16)]。然而,虽然最大似然训练对于下一个令牌预测有效,但无法完全捕捉期望的行为属性[8 (https://arxiv.org/html/2607.18258#bib.bib17)],包括主观质量判断[32 (https://arxiv.org/html/2607.18258#bib.bib18),16 (https://arxiv.org/html/2607.18258#bib.bib24)]、规范性约束[24 (https://arxiv.org/html/2607.18258#bib.bib23),34 (https://arxiv.org/html/2607.18258#bib.bib25)]和任务特定偏好[44 (https://arxiv.org/html/2607.18258#bib.bib26),17 (https://arxiv.org/html/2607.18258#bib.bib27)]。这种不匹配推动了偏好对齐,旨在引导模型行为朝向更好反映这些标准的输出。一个突出的框架是基于人类反馈的强化学习(RLHF),它从偏好比较中学习奖励模型,并通过强化学习优化策略[8 (https://arxiv.org/html/2607.18258#bib.bib17),25 (https://arxiv.org/html/2607.18258#bib.bib3)]。相关范式包括直接策略优化[27 (https://arxiv.org/html/2607.18258#bib.bib20)]、对比偏好学习[13 (https://arxiv.org/html/2607.18258#bib.bib28)]、比值偏好优化[14 (https://arxiv.org/html/2607.18258#bib.bib52)]以及其他反馈驱动的方法[30 (https://arxiv.org/html/2607.18258#bib.bib21)]。
##### RLHF与细粒度奖励分配。RLHF是一个被广泛研究的框架,用于将语言模型与来自人类反馈的偏好信号对齐。在典型流程中,从偏好比较中训练一个奖励模型[10 (https://arxiv.org/html/2607.18258#bib.bib33),2 (https://arxiv.org/html/2607.18258#bib.bib35)],然后语言模型通过策略梯度方法[25 (https://arxiv.org/html/2607.18258#bib.bib3),27 (https://arxiv.org/html/2607.18258#bib.bib20),39 (https://arxiv.org/html/2607.18258#bib.bib36)](最常用的是近端策略优化PPO [29 (https://arxiv.org/html/2607.18258#bib.bib19)])进行优化,以最大化预测的奖励。该框架被广泛用作语言生成中基于偏好的策略优化的标准方法[25 (https://arxiv.org/html/2607.18258#bib.bib3),36 (https://arxiv.org/html/2607.18258#bib.bib37)]。然而,传统的RLHF为每个生成的响应分配一个单一的标量奖励,产生一个粗糙且稀疏的学习信号,这使得信用分配复杂化并可能破坏优化的稳定性。
最近的工作探索了细粒度奖励机制来解决这一限制。Chan 等人 (https://arxiv.org/html/2607.18258#bib.bib4) 利用奖励模型的注意力权重在令牌层面对序列级奖励进行密集化[7 (https://arxiv.org/html/2607.18258#bib.bib4)],但注意力权重可能不可靠地反映因果令牌贡献。Yoon 等人 (https://arxiv.org/html/2607.18258#bib.bib1) 提出了 TLCR [40 (https://arxiv.org/html/2607.18258#bib.bib1)],它训练一个判别器来分配令牌级奖励,这需要额外的辅助模型。Zhong 等人 (https://arxiv.org/html/2607.18258#bib.bib10) 将 RLHF 重新表述为令牌级 MDP,并提出了 RTO [43 (https://arxiv.org/html/2607.18258#bib.bib10)],它从偏好数据中推导出令牌级奖励,但继承了 DPO 偏好建模的局限性,并引入了多阶段流程的复杂性。Chai 等人 (https://arxiv.org/html/2607.18258#bib.bib43) 提出了 MA-RLHF [6 (https://arxiv.org/html/2607.18258#bib.bib43)],它将令牌分组为宏动作以缓解长程信用分配,但预定义的宏动作仍然粗糙,可能限制语义适应性。Cao 等人 (https://arxiv.org/html/2607.18258#bib.bib5) 应用 Shapley 值根据边际令牌贡献来分配序列级奖励[5 (https://arxiv.org/html/2607.18258#bib.bib5)];然而,由此产生的信用与奖励模型的标量评估紧密耦合,可能对奖励噪声敏感。除了这些代表性方法外,最近的一系列方法研究了细粒度奖励分配[18 (https://arxiv.org/html/2607.18258#bib.bib12),28 (https://arxiv.org/html/2607.18258#bib.bib9),19 (https://arxiv.org/html/2607.18258#bib.bib13),37 (https://arxiv.org/html/2607.18258#bib.bib11)]。尽管形式各异,但大多数现有方法主要追求更密集的令牌级监督,而关于奖励的何种粒度对于基于偏好的 RLHF 是语义上有意义且优化稳定的问题仍未得到充分探索。
## 3 方法论
### 3.1 问题设定
给定提示 \(x\),策略 \(\pi_{\theta}\) 根据 \(\pi_{\theta}(\cdot|x)\) 生成响应 \(y=(t_1,\ldots,t_T)\)。一个基于偏好的奖励模型 \(R_{\phi}(x,y)\) 为整个响应分配一个标量序列级奖励。标准 RLHF 通过 KL 正则化目标优化策略:
\[
\max_{\theta}\; \mathbb{E}_{x\sim\mathcal{D},\, y\sim\pi_{\theta}(\cdot|x)}\left[ R_{\phi}(x,y) - \beta\,\mathrm{KL}\!\left(\pi_{\theta}(\cdot|x)\,\|\,\pi_{\rm ref}(\cdot|x)\right) \right].
\]
S2T-RLHF 保持奖励模型固定,并将这个序列级信号分解为句子级和令牌级的信用信号用于策略优化。纳什谈判和狄利克雷分布的背景介绍见附录 A (https://arxiv.org/html/2607.18258#A1)。
请参见标题下的图 1:S2T-RLHF 概述。全局序列级奖励首先通过句子间谈判(第一阶段)分解为句子级信用,然后通过狄利克雷后验推断(第二阶段)细化为令牌级奖励,从而在不修改奖励模型的情况下实现 RLHF 中稳定且可解释的信用分配。
### 3.2 语义驱动的奖励分解
在标准 RLHF 中,单个序列级标量奖励只提供对长生成轨迹的粗略监督,使得细粒度的信用分配从根本上不明确。这种不匹配常常导致不稳定的优化动态、过度局部的更新以及学习行为的有限可解释性。为了解决这一挑战,我们提出了 S2T-RLHF,这是一个两阶段的分层奖励分解框架,它将序列级的偏好信号转化为语义驱动的密集奖励,而无需额外的标注、奖励模型重新训练或部分序列查询。如图 1 (https://arxiv.org/html/2607.18258#S3.F1) 所示,S2T-RLHF 跨语义粒度分解奖励分配。在第一阶段,全局序列级奖励被分配到句子之间,生成一个结构化的、可解释的中间表示,该表示捕捉推理步骤或对话单元的相对语义贡献,同时保持总奖励量。在第二阶段,co相似文章
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解
本文研究了大型语言模型奖励模型中的偏好不稳定性,即微小的输入变化会导致矛盾的偏好分配。作者提出了两种基于SAE的缓解策略——SAE特征引导和SAE残差校正——在不重新训练的情况下减少错误的偏好分配。
@Ankur_Samanta_: 在多步推理强化学习后训练中关于信用分配的新工作 介绍自重置策略优化 (SRPO…
自重置策略优化 (SRPO) 通过在多步推理强化学习后训练中定位第一个错误的推理步骤并从中学习反事实延续,而无需外部监督,来解决信用分配问题。
ARCA:令牌信号退化时的适配器残差信用分配
本文指出了在使用LoRA进行LLM强化学习时,令牌级信用分配中存在的一种结构性失效模式,即内在信号退化。它提出了适配器残差信用分配(ARCA),该方法从适配器的隐藏状态残差中推导令牌显著性,并与基线方法保持竞争力。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。