基于不一致人类反馈的可靠性感知LLM对齐
摘要
提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。
arXiv:2607.20515v1 公告类型:新论文
摘要:基于人类反馈的强化学习(RLHF)对于将大型语言模型(LLM)与人类偏好对齐至关重要。然而,其有效性常因人类标注固有的不一致性和主观性而受到影响。现有的偏好优化框架,如直接偏好优化(DPO),通常将标注者意见分歧较大的模糊样本与达成一致共识的样本等同处理,迫使模型过拟合不一致的监督信号,导致对齐效果欠佳。本文提出可靠性引导的偏好优化(RGPO),这是一个旨在减轻不一致人类反馈影响的鲁棒框架。RGPO通过从嘈杂的人类反馈中估计标注者可靠性并推断潜在的真实标签,来识别可靠的偏好。此外,我们引入可靠性感知的一致性优化,根据标注的共识水平动态调整训练目标,确保模型优先处理高共识的监督信号。在LLM对齐基准上的大量实验表明,RGPO有效降低了训练数据中的不一致性和噪声,在性能上优于广泛采用的RLHF基线方法。我们的代码和配置可在 https://github.com/GenieHuang/RGPO 获取。
查看缓存全文
缓存时间: 2026/07/24 05:04
# 面向不一致人类反馈的可靠性感知大模型对齐 来源:https://arxiv.org/html/2607.20515 ###### 摘要 基于人类反馈的强化学习(RLHF)对于将大语言模型(LLMs)与人类偏好对齐至关重要。然而,其有效性常常因人类标注固有的不一致性和主观性而受到影响。现有的偏好优化框架,如直接偏好优化(DPO),通常将标注者分歧大的模糊样本与一致同意的样本同等对待,迫使模型过拟合到不一致的监督信号上,导致对齐效果次优。本文提出了**可靠性引导的偏好优化**(RGPO),这是一个旨在缓解不一致人类反馈影响的鲁棒框架。RGPO 估计标注者可靠性,并从嘈杂的人类反馈中推断潜在的真相标签,以识别鲁棒偏好。此外,我们引入了可靠性感知的一致性优化,该优化根据标注的共识水平动态调整训练目标,确保模型优先处理高共识的监督信号。在LLM对齐基准上的大量实验表明,RGPO 有效减少了训练数据中的不一致性和噪声,并且与广泛采用的 RLHF 基线相比取得了更优的性能。我们的代码和配置可在 https://github.com/GenieHuang/RGPO 获取。 机器学习,ICML
## 1 引言
随着大语言模型(LLMs)在从创意写作到复杂决策支持等不同领域的广泛采用,确保这些系统既有用又无害已成为一个重要的目标 (Askell et al., 2021 (https://arxiv.org/html/2607.20515#bib.bib1))。随着 LLMs 的能力日益增强,焦点已从生成连贯文本转向将模型输出与复杂的人类偏好和意图对齐 (Christiano et al., 2017 (https://arxiv.org/html/2607.20515#bib.bib8); Bai et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib3))。因此,利用人类反馈的对齐技术已成为现代训练流程中的关键组成部分 (Glaese et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib17))。它们弥合了 token 预测与以用户为中心的交互之间的差距 (Ouyang et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib28))。这种对齐不仅对于提高用户满意度至关重要,而且对于减轻诸如毒性或幻觉等安全风险也至关重要,而这些风险很难通过静态规则来定义 (Ganguli et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib15))。
与通常具有客观标准答案的数学推理或代码生成任务不同,基于人类反馈的强化学习(RLHF)任务主要是开放式的。在这种情况下,很少有一个唯一正确的响应,使得标注过程严重依赖于人类标注者基于微妙的准则来展示或排序更优的行为 (Menick et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib26))。为了利用人类偏好标注,研究人员开发了诸如近端策略优化(PPO)等框架,该框架训练一个独立的奖励模型为策略模型提供模拟反馈,并通过 KL 散度惩罚来约束训练过程以防止模式坍塌 (Schulman et al., 2017 (https://arxiv.org/html/2607.20515#bib.bib35); Stiennon et al., 2020 (https://arxiv.org/html/2607.20515#bib.bib38))。或者,直接偏好优化(DPO)通过完全消除奖励模型而出现。它构建“被选”和“被拒”对,基于偏好与非偏好响应之间的似然边际直接优化策略 (Rafailov et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib31))。然而,这两种方法都面临局限性:PPO 需要大量的计算资源来维护独立的奖励模型和价值模型,而 DPO 的有效性则对构建的偏好对的质量和可靠性极其敏感 (Azar et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib2); Meng et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib25))。
参见图注
图 1:*均匀集成*忽略了标注者不同的可靠性水平,而现有的 RLHF 框架(如 DPO)将具有强烈分歧的样本与具有一致偏好的样本同等对待,从而引入了潜在的不一致性。
一个更根本的挑战在于标注本身的性质。由于 RLHF 任务是开放式的,监督信号的质量在很大程度上取决于标注者的能力、注意力和文化背景,这在其可靠性中造成了显著的差异 (Sap et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib34); Santurkar et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib33))。除了这些个体差异之外,人类标注本质上是主观的,并且在这个过程中引入了潜在的不一致性 (Bakker et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib4))。这种不一致性常常通过不同标注者之间的高度分歧表现出来,由于个人偏好冲突或对模糊提示的真正分歧,噪声变得不可避免 (Chowdhury et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib7))。然而,大多数现有框架通过将有冲突的判断聚合为二元标签而忽视了这种复杂性 (Gordon et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib18))。例如,如图 1 (https://arxiv.org/html/2607.20515#S1.F1) 所示,如果一对响应收到了有争议的 3 比 2 的投票,现有方法将其与一致同意的 5 比 0 投票同等对待,迫使模型以完全置信度最大化所选响应和所拒响应之间的边际。这种对可靠性和不确定性的忽视导致模型过拟合到不一致性,从模糊数据中以无根据的置信度学习,并可能降低在清晰指令上的表现 (Gao et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib16))。
为了解决这些挑战,我们提出了一个显式建模标注者可靠性以解决数据不一致性的框架。我们直接将最大似然估计应用于 LLM 对齐循环,以统计区分可信信号与噪声 (Raykar et al., 2010 (https://arxiv.org/html/2607.20515#bib.bib32))。通过联合估计潜在的真相和标注者可靠性,我们识别出高置信度的偏好标签,而不是依赖于简单的聚合。此外,我们通过基于可靠性感知一致性水平的自适应缩放来调节训练过程,以优先处理来自最可靠来源的反馈。我们的主要贡献总结如下:
- 我们提出了**可靠性引导的偏好优化**(RGPO)框架,以系统地减轻多标注 RLHF 数据集中主观噪声和标注者不一致性导致的性能下降。
- 我们提出了**迭代潜在可靠性估计**来解决不一致标注的歧义,利用迭代最大似然估计来推断带有潜在真相标签的标注者可靠性。
- 我们设计了**可靠性感知一致性优化**,以防止模型过拟合到不一致数据,根据基于可靠性的监督信号共识水平动态缩放优化目标。
- 我们进行了大量实验,证明使用 RGPO 增强基线相比标准基线能带来更优的稳定性和对齐性能。
## 2 相关工作
#### 基于人类反馈的强化学习。
基于人类反馈的强化学习(RLHF)已成为将大语言模型(LLMs)与人类偏好对齐的基石 (Christiano et al., 2017 (https://arxiv.org/html/2607.20515#bib.bib8))。它将模型从文本生成器转变为有用的助手 (Ouyang et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib28); Bai et al., 2022 (https://arxiv.org/html/2607.20515#bib.bib3))。标准流程通常包括在人类偏好对上训练一个奖励模型,随后进行近端策略优化(PPO)(Schulman et al., 2017 (https://arxiv.org/html/2607.20515#bib.bib35); Stiennon et al., 2020 (https://arxiv.org/html/2607.20515#bib.bib38))。然而,RLHF 的有效性高度依赖于底层人类数据的质量,而这些数据通常是不一致且固有主观的 (Casper et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib6); Fernandes et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib14))。最近的研究表明,由于任务模糊性、标注者疲劳或缺乏领域专业知识,人类标注经常包含显著噪声 (Larson et al., 2019 (https://arxiv.org/html/2607.20515#bib.bib21))。具体来说,一些研究强调,不一致的偏好标签(其中标注的“赢家”与底层真相相矛盾)可能会灾难性地降低对齐模型的性能 (Chowdhury et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib7))。尽管如此,大多数现有的 RLHF 框架直接将标注视为真相,或者使用简单的均匀集成来聚合有冲突的标签 (Wu et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib44)),忽略了标注者可靠性的方差 (Peng et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib29))。虽然最近的一些方法尝试通过鲁棒损失函数来建模不一致性 (Liang et al., 2025 (https://arxiv.org/html/2607.20515#bib.bib23); Zhu et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib48)),但它们往往未能显式地建模与观测噪声标签不同的潜在标签,尤其是在经常发生分歧的多标注者设置中 (Uma et al., 2021 (https://arxiv.org/html/2607.20515#bib.bib40); Plank, 2022 (https://arxiv.org/html/2607.20515#bib.bib30))。相比之下,我们的 RGPO 框架通过潜在可靠性估计来解决这一限制,以识别真相并指导带有鲁棒监督信号的策略优化 (Dawid & Skene, 1979 (https://arxiv.org/html/2607.20515#bib.bib9))。
#### 直接偏好优化及其衍生对齐框架。
为了规避 PPO 的不稳定性和计算复杂性,引入了直接偏好优化(DPO)以在成对的偏好数据上直接优化策略 (Rafailov et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib31))。训练目标公式化为:
LDPO(πθ;πref)=−E(q,yw,yl)∼D[logσ(βlogπθ(yw|q)πref(yw|q)−βlogπθ(yl|q)πref(yl|q))]\small\begin{split}\mathcal{L}_{\text{DPO}}(\pi_{\theta};\pi_{\text{ref}})=-\mathbb{E}_{(q,y_w,y_l)\sim\mathcal{D}}\Big[\log\sigma\Big(\beta\log\frac{\pi_{\theta}(y_w|q)}{\pi_{\text{ref}}(y_w|q)} \\ -\beta\log\frac{\pi_{\theta}(y_l|q)}{\pi_{\text{ref}}(y_l|q)}\Big)\Big]\end{split}(1)
这一转变导致了众多衍生框架的发展,旨在增强稳定性和性能 (Zhao et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib47); Swamy et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib39))。例如,IPO (Azar et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib2)) 在 log 似然比上定义了一个平方误差目标,有效地将偏好差距回归到一个固定边际。同时,KTO (Ethayarajh et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib13)) 通过采用前景理论方法完全消除了对成对数据的需求。进一步的进展包括 SimPO (Meng et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib25)),它移除了参考模型以提高内存效率。其训练目标定义为:
LSimPO(πθ)=−E(q,yw,yl)∼D[logσ(β|yw|logπθ(yw|q)−β|yl|logπθ(yl|q)−γ)]\small\begin{split}\mathcal{L}_{\text{SimPO}}(\pi_{\theta})=-\mathbb{E}_{(q,y_w,y_l)\sim\mathcal{D}}\Big[\log\sigma\Big(\frac{\beta}{|y_w|}\log\pi_{\theta}(y_w|q) \\ -\frac{\beta}{|y_l|}\log\pi_{\theta}(y_l|q)-\gamma\Big)\Big]\end{split}(2)
此外,ORPO (Hong et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib19)) 将偏好对齐直接集成到预训练或有监督微调阶段。尽管有这些架构上的创新,这些方法仍然存在一个关键的局限性:它们在很大程度上将所有偏好样本视为同等信息量 (Liu et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib24); Yuan et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib46))。当前的损失函数通常为每个偏好对分配一个统一权重,忽略了标注者的可靠性水平或标注的一致性 (Santurkar et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib33); Dong et al., 2023 (https://arxiv.org/html/2607.20515#bib.bib10))。因此,具有专家一致同意的样本与标注者之间存在重大分歧的有争议样本以相同的梯度幅度进行优化 (Sharma et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib36))。这种统一处理对于噪声数据集来说是次优的,因为它迫使模型过拟合到模糊或可能不正确的标签上 (Xu et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib45); Song et al., 2024 (https://arxiv.org/html/2607.20515#bib.bib37))。相反,RGPO 采用基于标注者可靠性的一致性加权优化,以充分利用自适应的训练机制。
## 3 方法
参见图注
图 2:*迭代潜在可靠性估计*(蓝色框)和*可靠性感知一致性优化*(绿色框)。为了减轻标注过程中引入的不一致性,RGPO 利用迭代估计来推断标注者可靠性,并使用缩放的一致性权重来优化策略,以优先处理鲁棒的监督信号。
如图 2 (https://arxiv.org/html/2607.20515#S3.F2) 所示,RGPO 有两个主要模块来处理不一致的偏好数据并优化策略:
- **迭代潜在可靠性估计**:应用迭代最大似然估计来评估标注者可靠性,并从冲突的多标注者判断中识别潜在的真相。
- **可靠性感知一致性优化**:计算每个样本基于缩放可靠性的标注者分布一致性权重,并在训练期间调节优化目标的梯度幅度。
### 3.1 迭代潜在可靠性估计
从标注平台收集的人类偏好数据通常包含显著的标注者分歧,尤其是在有争议或主观的话题上,多个标注者为同一比较提供冲突的偏好。为了解决这种不一致性,我们提出了一种原则性的概率策略,该策略显式建模标注者可靠性,利用最大似然估计来联合且迭代地恢复可靠性分数和潜在偏好。给定一个查询 q,标注者池记为 {a1, a2, ..., aM},两个候选响应记为 rA 和 rB。每个标注者 aj 被要求评估每个响应并提供 s相似文章
通过改变理性度来缓解RLHF中的认知偏差
本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。
对齐篡改:人类反馈强化学习如何被利用来优化失调偏见
本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
分布鲁棒的列表级偏好优化
本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。