RLHF偏好数据中的评估者状态偏差:一个审计框架

arXiv cs.AI 论文

摘要

本文识别并形式化了RLHF偏好数据中的评估者状态偏差,即标注者的情绪状态可能混淆偏好标签。它提出了一个包含可证伪预测的审计框架来检测此类偏差。

arXiv:2607.16195v1 公告类型:新 摘要:我们识别出人类反馈强化学习(RLHF)中的一个结构性混淆因素。成对偏好标签本应反映被比较的输出,但也可能反映标注者在标注时的状态。在持续性压力或痛苦条件下,标注者的偏好可能随时间变化。因此,偏好数据除了编码对回复质量的判断外,还可能编码标注者的状态。这些变化不同于普通的意见分歧或随机标签噪声。它们依赖于状态,可能在工作条件相似的标注者之间共享,并可能通过奖励建模和策略优化传播。因此,我们提出评估者状态偏移作为RLHF偏好数据中一种合理且可检验的结构化偏差来源。本文针对这一偏差来源提出了一个假设和一个审计框架。我们定义了评估者状态偏移、评估者状态混淆和相关评估者状态偏差。我们还定义了生存级情感真实性作为一种可测量的响应模式,使用词汇、语用、话语和安全相关特征。我们分析了相关评估者状态偏差如何能在聚合中存活并进入学习到的奖励信号。我们推导出五个可证伪的预测和初始审计的效果量阈值。最后,我们提出了一个审计协议和试点研究计划,可应用于公开可用的指令微调模型。我们不推断任何特定已部署模型的训练历史。我们的目标是隔离RLHF偏好数据中一种合理且可检验的结构化偏差来源。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:36

# 强化学习人类反馈偏好数据中的评分者状态偏差:一个审计框架
来源:https://arxiv.org/html/2607.16195

Elena Kopteva
koptieva@illinois\.edu
伊利诺伊大学厄巴纳-香槟分校格兰杰工程学院物理系与伊利诺伊大学宇宙高级研究中心,伊利诺伊州厄巴纳 61801,美国

Vitaliy Hlynianyi\-Zhuk
hlyniany@gmail\.com
第聂伯罗国立大学应用数学系,第聂伯罗 49045,乌克兰
基辅现代心理与心理治疗研究所临床心理学系,基辅 01133,乌克兰

###### 摘要

我们在来自人类反馈的强化学习(RLHF)中识别出一个结构性混淆因素。成对偏好标签的目的是反映被比较的输出,但它们也可能反映评分者在标注期间的状态。在持续的应激或痛苦条件下,评分者的偏好可能随时间推移而发生变化。因此,偏好数据可以在编码关于回应质量的判断的同时,也编码评分者的状态。这些变化不同于普通的意见分歧或随机标签噪声。它们是状态依赖的,可能在相似条件下工作的标注者之间共享,并且可以通过奖励建模和策略优化传播。因此,我们提出评分者状态转移作为RLHF偏好数据中结构性偏差的一个合理且可测试的来源。本文提出一个假设和用于研究这种偏差的审计框架。我们定义了评分者状态转移、评分者状态混淆和相关评分者状态偏差。我们还定义了*生存水平情感真实性*作为一种可测量的响应模式,使用词汇、语用、话语和安全相关特征。我们分析了相关评分者状态偏差如何能够经受聚合并进入学习到的奖励信号。我们推导出五个可证伪的预测和用于初始审计的效应量阈值。最后,我们提出了一个审计协议和试点研究计划,可应用于公开可用的指令微调模型。我们并未推断任何特定已部署模型的训练历史。我们的目标是隔离RLHF偏好数据中结构性偏差的一个合理且可测试的来源。

###### 目录
1. 1 引言 (https://arxiv.org/html/2607.16195#S1)
2. 2 相关工作 (https://arxiv.org/html/2607.16195#S2)
   1. 2\.1 标注者偏差、分歧与立场性 (https://arxiv.org/html/2607.16195#S2.SS1)
   2. 2\.2 RLHF与机器学习中的信号不完善与放大 (https://arxiv.org/html/2607.16195#S2.SS2)
   3. 2\.3 测量文本中的响应风格与话语结构 (https://arxiv.org/html/2607.16195#S2.SS3)
3. 3 评分者状态偏差下作为偏好信号估计的RLHF (https://arxiv.org/html/2607.16195#S3)
   1. 3\.1 技术基础 (https://arxiv.org/html/2607.16195#S3.SS1)
   2. 3\.2 评分者状态转移与稳定目标假设 (https://arxiv.org/html/2607.16195#S3.SS2)
   3. 3\.3 共享条件与暴露代理 (https://arxiv.org/html/2607.16195#S3.SS3)
   4. 3\.4 劳动力结构与相关偏差 (https://arxiv.org/html/2607.16195#S3.SS4)
4. 4 评分者状态偏差如何通过RLHF传播 (https://arxiv.org/html/2607.16195#S4)
   1. 4\.1 进入偏好信号 (https://arxiv.org/html/2607.16195#S4.SS1)
   2. 4\.2 被奖励模型吸收 (https://arxiv.org/html/2607.16195#S4.SS2)
   3. 4\.3 在策略优化期间放大 (https://arxiv.org/html/2607.16195#S4.SS3)
5. 5 评分者状态转移的经验前提 (https://arxiv.org/html/2607.16195#S5)
6. 6 假设与可证伪预测 (https://arxiv.org/html/2607.16195#S6)
7. 7 度量、审计协议与试点研究 (https://arxiv.org/html/2607.16195#S7)
   1. 7\.1 特征分类 (https://arxiv.org/html/2607.16195#S7.SS1)
   2. 7\.2 审计协议 (https://arxiv.org/html/2607.16195#S7.SS2)
   3. 7\.3 试点研究:工具验证 (https://arxiv.org/html/2607.16195#S7.SS3)
8. 8 讨论 (https://arxiv.org/html/2607.16195#S8)
9. 9 结论 (https://arxiv.org/html/2607.16195#S9)
10. 参考文献 (https://arxiv.org/html/2607.16195#bib)

## 1 引言

来自人类反馈的强化学习(RLHF)被广泛用于将大型语言模型与人类偏好对齐[6 (https://arxiv.org/html/2607.16195#bib.bib1), 35 (https://arxiv.org/html/2607.16195#bib.bib2)]。我们研究RLHF中使用的偏好数据,将其视为结构性标注偏差的潜在场所。核心对象是成对偏好标签:给定两个模型输出,评分者记录哪一个更受偏好,这些标签成为奖励建模的目标。因此,偏好标签并非对输出质量的直接测量,而是一个关于比较判断的情境记录。越来越多的研究表明,标注者的身份、信念和文化背景会影响标注数据[46 (https://arxiv.org/html/2607.16195#bib.bib3), 45 (https://arxiv.org/html/2607.16195#bib.bib4), 17 (https://arxiv.org/html/2607.16195#bib.bib5)]。这促使了将分歧视为结构性信号而非噪声的方法[2 (https://arxiv.org/html/2607.16195#bib.bib6), 39 (https://arxiv.org/html/2607.16195#bib.bib7), 8 (https://arxiv.org/html/2607.16195#bib.bib8)]。在此,我们关注一个不同的结构来源:评分者在标注期间的状态,而非相对稳定的评分者特质。我们探究标注条件如何系统地改变评分者所奖励的内容。所谓标注条件,我们指工作进行的外部环境。而评分者状态,我们指评分者在这些环境下当前的内部配置,包括情感、注意力和调节。我们引入以下定义:**评分者状态转移**是评分者在标注期间状态的系统性变化,由标注条件和更广泛的外部压力塑造,并持续一段时间;**评分者状态混淆**是指记录的偏好标签反映了该状态,而非关于输出质量的稳定判断。当评分者状态转移进入记录的偏好标签时,它就变成了评分者状态混淆;当这种混淆在评分者之间共享并被学习保留时,它们就成为奖励模型中**相关评分者状态偏差**的一个来源。我们并未声称识别任何特定已部署模型的训练历史。我们的主张是,评分者状态偏差是RLHF偏好数据中一个合理且可测试的失真来源。

在实践中,RLHF偏好标签由有偿标注者生成,他们在受管理的数据生产系统中工作,通常通过众包或承包商安排,而非在理想的实验室条件下[18 (https://arxiv.org/html/2607.16195#bib.bib10), 42 (https://arxiv.org/html/2607.16195#bib.bib56)]。更广泛地,在NLP和数据集创建中,标注质量不仅取决于被标注的项目,还取决于劳动力选择、培训、资格筛选、反馈、报酬和任务设计[21 (https://arxiv.org/html/2607.16195#bib.bib58), 27 (https://arxiv.org/html/2607.16195#bib.bib57)]。这些操作条件在这里很重要,因为它们提供了一条自然途径,使标注可能变得依赖于状态:评分者注意到、容忍、奖励或拒绝的内容可能随着标注执行的条件而改变。我们提出了一个连接所引入定义与训练工作流程的具体机制。评分者状态混淆以跨暴露于相似标注条件的评分者的相关标签转移形式进入偏好信号(第4.1节 (https://arxiv.org/html/2607.16195#S4.SS1))。由于奖励模型被训练以最大化观察到的偏好概率,它无法区分状态驱动的共识与真实质量共识;相关混淆与目标信号一起被吸收到学习到的奖励函数中(第4.2节 (https://arxiv.org/html/2607.16195#S4.SS2))。在策略优化期间,KL约束策略随后针对奖励模型所学到的任何内容进行优化,包括吸收的混淆,从而在生成输出中放大失真(第4.3节 (https://arxiv.org/html/2607.16195#S4.SS3))。

本文提出了一个假设和一个审计框架。它并未论证任何观察到的模型行为可归因于单一原因。核心点是,如果标注条件能在偏好标注期间系统地影响评分者,那么RLHF偏好数据可能包含一个结构化的、可测试的失真来源,应该直接加以研究。

本文组织如下。第2节 (https://arxiv.org/html/2607.16195#S2)回顾了关于标注者偏差、RLHF中信号不完善以及测量文本响应风格的相关工作。第3节 (https://arxiv.org/html/2607.16195#S3)将偏好训练形式化为偏好信号估计,并引入评分者状态框架。第4节 (https://arxiv.org/html/2607.16195#S4)追踪了评分者状态偏差如何通过RLHF传播。第5节 (https://arxiv.org/html/2607.16195#S5)总结了评分者状态转移的经验前提。第6节 (https://arxiv.org/html/2607.16195#S6)陈述了假设和可证伪预测。第7节 (https://arxiv.org/html/2607.16195#S7)定义了测量分类、审计协议和试点研究。第8节 (https://arxiv.org/html/2607.16195#S8)讨论了启示和局限性,第9节 (https://arxiv.org/html/2607.16195#S9)给出结论。

## 2 相关工作

本节汇集了多条相关的研究线索,这些线索框定了我们所研究的现象。在本文中,我们考虑这样一种可能性:RLHF偏好标签可能因评分者在标注期间的状态变化而系统性失真,并且这种失真可能通过奖励建模和下游训练持续存在。这里回顾的研究之所以相关,是因为它们表明标注数据通常既反映标注者也反映项目,学习到的奖励信号中的不完美在优化过程中可能被放大,并且响应风格可以通过文本层面的可重复测量进行审计。

最接近的先前工作是关于标注者偏差、分歧和立场性的文献。这些文献表明,标签变异通常具有结构,而非仅仅是噪声。我们的贡献是将该逻辑从相对稳定的标注者特征扩展到由标注条件引起的评分者内部变异。我们将评分者状态转移、评分者状态混淆和相关评分者状态偏差定位于该空间中。

### 2.1 标注者偏差、分歧与立场性

大量研究表明,标注数据不仅由被标注的项目塑造,也由进行标注的人塑造。Sap等人[46 (https://arxiv.org/html/2607.16195#bib.bib3)]表明标注者的信念和身份影响有毒语言标签。Gordon等人[17 (https://arxiv.org/html/2607.16195#bib.bib5)]引入了陪审团学习作为一种保留异议标注者视角而非将其合并为单一多数标签的方法。Santy等人[45 (https://arxiv.org/html/2607.16195#bib.bib4)]表明NLP数据集和模型不成比例地与西方、白人、大学教育和较年轻人群对齐。Plank[39 (https://arxiv.org/html/2607.16195#bib.bib7)]认为,人类标签变异通常应被视为信息性信号而非噪声,Davani等人[8 (https://arxiv.org/html/2607.16195#bib.bib8)]表明,保留个体标注者视角的模型在主观任务上可以胜过多数投票聚合。更广泛地,关于机器学习中交叉性公平性的工作强调,社会结构性差异不能简化为单一人口统计学轴线,并且在标注和评估过程将人类判断视为统一时可能被掩盖[16 (https://arxiv.org/html/2607.16195#bib.bib55)]。

这些文献是我们论证最接近的接触点。它们表明标注数据中的分歧通常具有结构,并且这种结构可以反映视角、立场和社会经验,而不仅仅是标注错误。然而,在这些工作的大部分中,相关的变异来源被视为随时间相对稳定。它们与标注者是谁、标注者如何被定位、或者标注者带来什么背景相关。我们的贡献是将注意力转向一个不同的结构化变异来源:评分者在标注期间状态的变化。关键思想并非评分者在稳定方式上彼此不同,而是同一评分者在不同标注条件下可能做出不同判断。这将讨论从持久的标注者特征转向在标注过程中本身可能出现的变异。在这个意义上,我们的框架将结构化分歧的逻辑扩展到了一个场景,其中相关的变异来源不是固定的视角,而是操作条件下的状态依赖判断。

### 2.2 RLHF与机器学习中的信号不完善与放大

对齐中的一个核心关切是,优化可能会放大被优化信号中的不完善性。在RLHF中,Gao等人[15 (https://arxiv.org/html/2607.16195#bib.bib15)]描述了奖励模型过度优化,表明针对不完美的学习奖励进行策略优化可以以类似Goodhart的方式降低真实性能,即优化代理而非预期目标。他们还推导了这种效应的缩放定律。Rafailov等人[40 (https://arxiv.org/html/2607.16195#bib.bib16)]将此关切扩展到直接对齐方法,表明即使没有显式奖励模型,也可能出现相关形式的过度优化。

更广泛的机器学习文献显示了类似模式。Zhao等人[58 (https://arxiv.org/html/2607.16195#bib.bib17)]证明图像分类器可以放大性别活动相关性,使其超过训练数据中的比率。Wang和Russakovsky[56 (https://arxiv.org/html/2607.16195#bib.bib18)]形式化了方向性偏差放大,并表明其部分依赖于识别群组成员和类别成员的相对难度。Hall等人[19 (https://arxiv.org/html/2607.16195#bib.bib19)]提供了偏差放大的首个系统研究,表明该效应随模型容量、训练集大小和训练时长而变化,且不与数据集大小单调相关。最近,Subramonian等人[53 (https://arxiv.org/html/2607.16195#bib.bib20)]在岭回归中解析地证明,过参数化可以在没有类别不平衡的情况下放大群体水平偏差,产生不会通过单纯增加模型大小而消失的差异。

总之,这些研究支持一个对于我们论证很重要的普遍观点:训练信号中的不完善性可以在学习中存续并通过优化变得更强。我们的贡献是在RLHF偏好数据中识别出这种不完善性的一个特定来源。如果标注条件引起系统性的评分者状态转移,并且这些转移作为评分者状态混淆进入记录的偏好标签,那么学习到的奖励信号可能反映的内容超出了预期的比较目标。当这些混淆在评分者之间共享并在训练中保留时,它们就创建了一条从标注条件到下游模型行为中相关评分者状态偏差的合理路径。第4节 (https://arxiv.org/html/2607.16195#S4)将详细阐述这一论证。

### 2.3 测量文本中的响应风格与话语结构

用于研究文本中响应风格的计算方法发展良好。在这个更广阔的空间中,测量情感和情绪的工具提供了一组特别稳健且可重复的度量。词汇资源如LIWC[36 (https://arxiv.org/html/2607.16195#bib.bib21)]、VADER[22 (https://arxiv.org/html/2607.16195#bib.bib

相似文章

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

偏好平均导致的RLHF程序公平性失败

arXiv cs.LG

本文指出,RLHF因平均化异质偏好而导致程序公平性失败:多数群体主导奖励学习,少数偏好代表性不足。文章提出了偏好感知RLHF(PA-RLHF),在受控实验中提升了对齐准确率并缩小了公平性差距。

隐藏的共识:人类反馈中的偏好有效性压缩

arXiv cs.CL

本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。

审计多模态LLM评分器:临床序数评分中的中央趋势偏差

Hugging Face Daily Papers

本文研究了用于临床序数评分(画钟测试)的多模态LLM中的中央趋势偏差。研究发现,LLM将预测结果向量表中间压缩,对关键极端值造成不成比例的影响。该研究将LLM作为裁判的偏差文献扩展到临床评估领域,强调在部署前需要进行校准感知评估。