为什么摘要变得中立:基于人类反馈的强化学习中情感漂移的策略归因

arXiv cs.CL 论文

摘要

本文定义并量化了RLHF训练的摘要模型中的情感漂移,提出了一个策略归因框架来识别原因,并引入了一种情感感知KL正则化方法来减少漂移。

arXiv:2608.15530v1 公告类型:新 摘要:基于人类反馈的强化学习(RLHF)将大型语言模型与人类偏好对齐,提高了摘要的流畅性和安全性,但导致了情感漂移:过度中立的摘要被剥离了情感细微差别。我们诊断了为什么强化学习充当情感中和器,并提出了策略归因,一个使用梯度和逻辑分解来将漂移追溯到奖励模型信号和KL惩罚的框架。情感漂移反映了在偏好不确定性下最大化预期奖励的“低风险”令牌的战略偏差(Stiennon et al., 2020; Gao, Schulman, and Hilton, 2023)。在Reddit TL;DR和CNN/DailyMail上,RLHF摘要获得了更高的奖励,但情感方差降低了30-40%。跨八种语言的跨语言分析显示了语言无关的漂移,形态更丰富的语言受到更严重的抑制(Krasitskii et al., 2026)。我们提出并验证了一种情感感知正则化技术,在不损害摘要质量的情况下,将漂移减少了18-22%。代码和工具包将公开。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:10

# 为何摘要趋于中性:基于人类反馈的强化学习中情感漂移的策略归因  
来源:https://arxiv.org/html/2608.15530 \[2pt\] 国立理工学院(IPN)计算研究中心(CIC)\[2pt\] mkrasitskii2023, gelbukh, kolesnikova, [email protected]  

## 1 引言  
基于人类反馈的强化学习(RLHF)的出现从根本上重塑了自然语言生成,使大型语言模型在有用性、安全性和流畅性方面超越监督基线\[12 (https://arxiv.org/html/2608.15530#bib.bib11)\]。然而,这种对齐引入了一个隐藏的成本:中性陷阱。当模型优化以避免争议性输出时,它们无意中抑制了对忠实传达情感至关重要的情感内容,这对于情感分析等下游任务是一个关键问题。  

### 1.1 RLHF中的情感漂移  
随着强化学习训练的进行,摘要变得越来越中性且情感趋于扁平化。虽然事实正确性提高,但情感标记(强化词、评价性形容词)逐渐减弱。例如,一个监督微调(SFT)的摘要可能会将情况描述为“深感担忧”,而经过RLHF训练的模型可能会将其替换为中性的事实陈述。原始情感与摘要情感之间的这种系统性差异,我们称之为情感漂移。具体而言,我们特指情感分数方差的减小(表明向中性靠拢)以及单个情感标记强度的降低。  

### 1.2 诊断挑战  
为什么策略会选择中性?先前的工作将其归因于保守的奖励建模或过度正则化\[4 (https://arxiv.org/html/2608.15530#bib.bib4)\],但解释仍然是定性的。我们假设情感标记会引入更高的奖励方差,使其在优先考虑稳定性的优化方案下吸引力降低。尽管存在轶事证据,但缺乏系统的方法来测量和归因这种效应,尤其是在多语言环境中。  

### 1.3 我们的贡献:策略归因  
为了超越轶事观察,我们提出了策略归因,一个分解强化学习目标组件以识别情感抑制驱动因素的框架。我们的贡献包括:  
- • 我们正式定义并量化了在主要基准测试中的情感漂移,并通过八种类型学各异的语言进行了多语言验证。  
- • 我们引入了策略归因,按强化学习组件(奖励、KL、裁剪)分解策略梯度以识别因果驱动因素。我们的分析显示,KL正则化在情感标记的负归因中占约82%。  
- • 我们证明情感损失是一种符合RLHF动态的策略性“低风险”结果\[4 (https://arxiv.org/html/2608.15530#bib.bib4)\],并将分析扩展到直接偏好优化(DPO),以表明这种抑制在各种对齐方法中持续存在。  
- • 我们提出并验证了情感感知KL正则化,在保持ROUGE-L与标准RLHF相比差异在0.5点以内的同时,将漂移减少了18-22%。  
- • 我们发布了我们的策略归因工具包,以支持可重复性和注重效应的对齐研究。  

## 2 背景与相关工作  
### 2.1 文本摘要中的RLHF  
将大型语言模型(LLM)与人类偏好对齐的标准流程包括三个阶段:监督微调(SFT)、奖励建模(RM)和强化学习(RL)\[12 (https://arxiv.org/html/2608.15530#bib.bib11)\]。在摘要任务的背景下,强化学习阶段通常采用近端策略优化(PPO)\[10 (https://arxiv.org/html/2608.15530#bib.bib9)\]来最大化预期奖励,同时保持与SFT模型的Kullback-Leibler(KL)散度约束。目标函数定义为:  
J⁡\(θ\)=Ex∼D,y∼πθ⁡\[Rφ\(x,y\)−βlog⁡πθ\(y\|x\)πref\(y\|x\)\]  
J\(\\theta\)=\\operatorname\{E\}\_\{x\\sim\\mathcal\{D\},y\\sim\\pi\_\{\\theta\}\}\\big\[R\_\{\\phi\}\(x,y\)\-\\beta\\log\\frac\{\\pi\_\{\\theta\}\(y\|x\)\}\{\\pi\_\{\\text\{ref\}\}\(y\|x\)\}\\big\] \(1\)  
其中Rφ\(x,y\)R\_\{\\phi\}\(x,y\)是标量奖励,β\\beta控制KL散度惩罚的强度。虽然这种公式稳定了训练,但已被证明当模型为满足RM而过度优化摘要长度时,会导致退化行为\[4 (https://arxiv.org/html/2608.15530#bib.bib4)\]。近期工作已超越基于PPO的RLHF,转向直接对齐方法,如直接偏好优化(DPO)\[9 (https://arxiv.org/html/2608.15530#bib.bib8)\]和Kahneman-Tversky优化(KTO)\[3 (https://arxiv.org/html/2608.15530#bib.bib3)\]。这些方法通过直接针对偏好数据优化策略参数,消除了显式奖励模型和KL惩罚。然而,这些方法是否表现出类似的情感抑制仍是一个开放问题。我们的工作首次系统比较了PPO和DPO框架下情感漂移。  

### 2.2 奖励过度优化现象  
大量研究记录了“奖励黑客”现象,即模型利用奖励函数的弱点来最大化分数,而不改善真实任务性能。在摘要任务中,这表现为冗长偏差、过度模糊或风格扁平化。虽然先前工作研究了奖励过度优化下的事实退化和幻觉\[4 (https://arxiv.org/html/2608.15530#bib.bib4)\],但以中性替代方案系统性抑制情感强度仍未被充分探索。\[15 (https://arxiv.org/html/2608.15530#bib.bib14)\]证明了KL正则化的RLHF在偏好不确定性下系统地使策略偏向保守动作分布。我们的工作扩展了这一理论发现,提供了经验证据表明,携带情感的标记不成比例地受到这种保守主义的影响,尤其是在情感编码因类型学而异的多语言环境中。  

### 2.3 大型语言模型的可解释性与归因  
理解神经模型的决策过程长期以来一直是自然语言处理研究的核心关注点。特征归因方法,如积分梯度\[13 (https://arxiv.org/html/2608.15530#bib.bib12)\]、SHAP\[8 (https://arxiv.org/html/2608.15530#bib.bib7)\]和基于梯度的分析,已被广泛应用于解释深度神经网络的预测。最近,可解释性研究转向对大规模语言模型进行基于机制、理论支持的解释,尤其是在生成环境中,理解风格和情感行为至关重要\[2 (https://arxiv.org/html/2608.15530#bib.bib2)\]。近期的理论工作为归因方法提供了正式视角,阐明了基于梯度的解释在何种假设下能可靠地捕捉模型行为\[14 (https://arxiv.org/html/2608.15530#bib.bib13)\]。这些方法能够对生成动态进行标记级和组件级分析,使其适合诊断情感抑制等细微现象。  

### 2.4 情感与风格保留  
保持源文本的风格和情感完整性长期以来被认为是文本生成中的一个挑战。先前在风格迁移\[11 (https://arxiv.org/html/2608.15530#bib.bib10)\]、情感控制生成\[7 (https://arxiv.org/html/2608.15530#bib.bib6)\]和情感感知摘要\[5 (https://arxiv.org/html/2608.15530#bib.bib5)\]方面的研究表明,保留情感基调需要显式的建模约束。在多语言环境中,这种挑战因类型学差异和基于文化的情感表达而进一步加剧\[1 (https://arxiv.org/html/2608.15530#bib.bib1)\]。我们的工作通过将情感保留构建为一个策略级优化问题,并提出一种基于归因的方法来保留强化学习微调摘要器中的意图保真度,连接了这些研究路线。与先前启发式修改奖励函数的工作不同,我们提供了对哪些目标组件驱动情感损失的机制性诊断,从而实现针对性干预。  

## 3 方法论  
我们的方法论评估了RLHF优化对情感保留的影响,并将观察到的漂移归因于特定的训练目标组件。该框架由三个模块组成:(1)具有可变正则化的RLHF训练流程,(2)多语言情感评估套件,以及(3)用于梯度分解的策略归因机制。  

### 3.1 RLHF训练流程  
我们遵循标准的PPO流程\[10 (https://arxiv.org/html/2608.15530#bib.bib9)\]。给定提示x,策略πθ\\pi\_\{\\theta\}生成摘要y。目标函数J⁡\(θ\)J\(\\theta\)最大化预期奖励,同时惩罚与参考模型πref\\pi\_\{\\text\{ref\}\}(SFT检查点)的偏差:  
J\(θ\)=Ex∼D,y∼πθ\[Rφ\(x,y\)−−β⋅KL\(πθ\(⋅\|x\)∥πref\(⋅\|x\)\)\]  
\\begin\{split\}J\(\\theta\)=\\operatorname\{E\}\_\{x\\sim\\mathcal\{D\},y\\sim\\pi\_\{\\theta\}\}\\big\[&R\_\{\\phi\}\(x,y\)\-\\\\ \-\\beta\\cdot\\text\{KL\}\(\\pi\_\{\\theta\}\(\\cdot\|x\)\\\|\\pi\_\{\\text\{ref\}\}\(\\cdot\|x\)\)\\big\]\\end\{split\} \(2\)  
其中RφR\_\{\\phi\}是标量奖励,β\\beta控制KL散度惩罚强度。我们训练了β∈\{0\.05,0\.1,0\.2\}\\beta\\in\\\{0\.05,0\.1,0\.2\\\}范围内的模型(表1 (https://arxiv.org/html/2608.15530#S4.T1))。与先前工作不同,我们在反向传播过程中明确跟踪每个项的梯度贡献。  

### 3.2 多语言情感评估  
我们使用预训练的基于Transformer的情感分类器来处理八种类型学各异的语言。对于源文本S和摘要Ŝ,我们计算情感分布P⁡\(y\|S\)P\(y\|S\)和P⁡\(y\|S^\)P\(y\|\\hat\{S\}\)。情感方差(SV)衡量数据集上情感分数的方差;减小表明向中性输出收敛。我们还通过Jensen-Shannon散度衡量分布偏移:  
JSD\(P∥Q\)=12DKL\(P∥M\)\+12DKL\(Q∥M\)  
\\begin\{split\}\\text\{JSD\}\(P\\\|Q\)=\\frac\{1\}\{2\}D\_\{\\text\{KL\}\}\(P\\\|M\)\+\\frac\{1\}\{2\}D\_\{\\text\{KL\}\}\(Q\\\|M\)\\end\{split\} \(3\)  
其中M=12\(P\+Q\)M=\\frac\{1\}\{2\}\(P\+Q\)。较低的JSD表明对原始情感分布的保留更好。分类器保持冻结,以确保偏移完全可归因于策略更新。基于多语言情感分析的最新进展,我们的评估框架遵循\[6 (https://arxiv.org/html/2608.15530#bib.bib15)\]建立的方法,他们证明摘要中的情感保留在不同语言间系统性变化,并且对于形态丰富的语言尤其具有挑战性。他们的跨语言分析为我们的语言选择和评估协议提供了经验基础。  

### 3.3 策略归因框架  
策略归因将总策略梯度分解为不同目标组件的贡献。与将预测归因于输入特征的标准归因方法不同,我们将策略更新归因于损失分量。令∇θLtotal\\nabla\_\{\\theta\}\\mathcal\{L\}\_\{total\}为总梯度。基于公式2 (https://arxiv.org/html/2608.15530#S3.E2),其分解为:  
∇θLtotal=∇θLreward\+β⋅∇θLKL\+∇θLclip  
\\begin\{split\}\\nabla\_\{\\theta\}\\mathcal\{L\}\_\{total\}=\\nabla\_\{\\theta\}\\mathcal\{L\}\_\{reward\}\+\\beta\\cdot\\nabla\_\{\\theta\}\\mathcal\{L\}\_\{KL\}\+\\nabla\_\{\\theta\}\\mathcal\{L\}\_\{clip\}\\end\{split\} \(4\)  
其中Lreward=−Rφ\(x,y\)\\mathcal\{L\}\_\{reward\}=\-R\_\{\\phi\}\(x,y\),LKL=log⁡πθ\(y\|x\)πref\(y\|x\)\\mathcal\{L\}\_\{KL\}=\\log\\frac\{\\pi\_\{\\theta\}\(y\|x\)\}\{\\pi\_\{\\text\{ref\}\}\(y\|x\)\},Lclip\\mathcal\{L\}\_\{clip\}是PPO代理损失裁剪项。  

**标记级归因分数**。对于序列y中的标记tᵢ,我们计算组件c∈\{reward,KL,clip\}c∈\\\{\\text\{reward\},\\text\{KL\},\\text\{clip\}\\\}的归因分数Ac\(ti\)A\_\{c\}\(t\_\{i\}\)。我们调整了积分梯度\[13 (https://arxiv.org/html/2608.15530#bib.bib12)\]:  
Ac\(ti\)=\(θ−θ′\)⋅∫α=01∂Lc\(θ′\+α⁡\(θ−θ′\)\)∂log⁡πθ\(ti\|x,y0\.8p\>0\.8\)。  

### 4.5 DPO实验设置  
为检验情感漂移是特定于基于PPO的RLHF,还是适用于直接对齐方法,我们使用直接偏好优化(DPO)\[9 (https://arxiv.org/html/2608.15530#bib.bib8)\]训练了额外模型。我们使用相同的基础模型(Llama-3-8B、Mistral-7B)和数据集,偏好对按照\[9 (https://arxiv.org/html/2608.15530#bib.bib8)\]的协议从Reddit TL;DR和CNN/DailyMail验证集构建。DPO目标为:  
LDPO\(θ\)=−E\(x,yw,yl\)\[logσ\(βlog⁡πθ\(yw\|x\)πref\(yw\|x\)−βlogπθ\(yl\|x\)πref\(yl\|x\)\)\]  
\\begin\{split\}\\mathcal\{L\}\_\{\\text\{DPO\}\}\(\\theta\)=\-\\operatorname\{E\}\_\{\(x,y\_\{w\},y\_\{l\}\)\}\\big\[\\log\\sigma\\big\(&\\beta\\log\\frac\{\\pi\_\{\\theta\}\(y\_\{w\}\|x\)\}\{\\pi\_\{\\text\{ref\}\}\(y\_\{w\}\|x\)\}\\\\ &\-\\beta\\log\\frac\{\\pi\_\{\\theta\}\(y\_\{l\}\|x\)\}\{\\pi\_\{\\text\{ref\}\}\(y\_\{l\}\|x\)\}\\big\)\\big\]\\end\{split\} \(6\)  
其中ywy\_\{w\}和yly\_\{l\}分别是首选和非首选摘要。我们变化β∈\{0\.1,0\.2,0\.5\}\\beta\\in\\\{0\.1,0\.2,0\.5\\\},并使用相同的指标评估情感漂移。结果报告在表6 (https://arxiv.org/html/2608.15530#S5.T6)中。  

### 4.6 缓解实验:情感感知正则化  
基于我们的归因分析,我们提出并验证了一种情感感知KL正则化技术。关键见解是,对于被识别为携带情感的标记,KL惩罚应当放宽。我们修改公式2 (https://arxiv.org/html/2608.15530#S3.E2)如下:  
JSA\(θ\)=Ex,y\[Rφ\(x,y\)−β⋅\(1−γ⋅Isent\(ti\)\)⋅KL\(πθ∥πref\)\]  
\\begin\{split\}J\_\{\\text\{SA\}\}\(\\theta\)=\\operatorname\{E\}\_\{x,y\}\\big\[R\_\{\\phi\}\(x,y\)\\\\ \-\\beta\\cdot\(1\-\\gamma\\cdot\\operatorname\{I\}\_\{\\text\{sent\}\}\(t\_\{i\}\)\)\\cdot\\text\{KL\}\(\\pi\_\{\\theta\}\\\|\\pi\_\{\\text\{ref\}\}\)\\big\]\\end\{split\} \(7\)  
其中Isent⁡\(ti\)=1\\operatorname\{I\}\_\{\\text\{sent\}\}\(t\_\{i\}\)=1如果标记tᵢ被识别为携带情感(通过词典或分类器置信度\>0.8),γ∈\[0,1\]\\gamma\\in\[0,1\]控制放宽强度。我们基于小规模验证扫描设置γ=0.3\\gamma=0.3。此公式降低了情感标记的KL惩罚,允许策略在与奖励信号一致时保留情感表达性。我们使用此修改目标在Reddit TL;DR和CNN/DailyMail上训练模型,保持所有其他超参数与基线RLHF设置相同。结果表明,在ROUGE-L未退化的情况下,情感漂移减少(18-22%改进),报告在表7 (https://arxiv.org/html/2608.15530#S5.T7)中。  

## 5 结果与分析  
本节分析不同训练机制下的情感漂移,重点关注RLHF优化引发的系统性模式。  

### 5.1 定量情感漂移  
图1 (https://arxiv.org/html/2608.15530#S5.F1)显示,较高的KL系数β值在两个数据集中都引发了更强的中性偏差。表2 (https://arxiv.org/html/2608.15530#S5.T2)证实,抽象式摘要表现出最大的情感方差减小,而抽取式方法更好地保留了情感线索。跨语言结果(表3 (https://arxiv.org/html/2608.15530#S5.T3))揭示,形态丰富的语言(芬兰语、匈牙利语)表现出更显著的抑制,表明屈折情感编码尤其脆弱。

相似文章

通过人类反馈学习总结

OpenAI Blog

OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

奖励模型可能过于敏感(22分钟阅读)

TLDR AI

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。