超越Shapley:一种基于影响力的LLM对齐与评估数据审计管线

arXiv cs.LG 论文

摘要

介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。

arXiv:2607.22766v1 公告类型:新 摘要:大型语言模型(LLM)的对齐日益受限于数据质量。随着数据集的扩展,海量的偏好和指令微调语料不可避免会积累隐藏的结构性矛盾、安全风险以及系统性的人工标注错误。标准的数据集审计方法,如语义去重或LLM-as-a-judge,难以捕捉单个记录的实际预测影响,并且常常忽略深层的功能规则冲突。为解决这一问题,我们引入了一种可扩展的、仅需推理的数据估值管线,该管线在不进行迭代模型重训练的情况下近似Shapley值。通过将语义k-NN邻域映射为有向图,我们的框架直接利用参考LLM的概率分布,通过零样本和单样本的条件对数似然变化来评估数据效用。随后,我们的管线将这些预测影响分数转化为局部优势度量,以隔离梯度冲突记录。我们展示了该管线在清洗两个经过严格审查的对齐数据集方面的有效性。首先,将我们的管线应用于HelpSteer2数据集,将手动审计搜索空间减少了99.1%,成功发现了多种故障模式下的错误标注记录。其次,将我们的自动审计策略应用于Anthropic的HH-RLHF训练和评估划分,识别出数千个隐藏的安全性和事实偏好反转。关键是,通过将审计扩展到评估划分,我们揭示了当前基准测试完整性的严重漏洞:高性能模型常常预测更安全或更有帮助的回应,却因客观上存在缺陷的人工真实标签而受到惩罚。总体而言,我们的工作提供了一种数学上严谨、高效的诊断工具,用于发现人工标签错误、清理评估基准,并确保LLM对齐数据的完整性。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:21

# 超越夏普利值:一种基于影响力的数据审计流程,用于大语言模型对齐与评估
来源:https://arxiv.org/html/2607.22766

Yunting Song Google 山景城,加利福尼亚州 94043 ytsong@google\.com
Matthew Watson Google 山景城,加利福尼亚州 94043 mattdangerw@google\.com
Peter Grabowski Google 山景城,加利福尼亚州 94043 petergrabowski@google\.com
&Jun Qin Google 山景城,加利福尼亚州 94043 junqin@google\.com

###### 摘要

大语言模型(LLM)的对齐日益受到数据质量的制约。随着数据集规模不断扩大,海量的偏好数据和指令微调语料库不可避免地积累了隐藏的结构性矛盾、安全风险以及系统性的标注错误。标准的审计方法,如语义去重或LLM-as-a-judge,难以捕捉单个记录对模型预测的实际影响,并且常常遗漏深层的功能规则冲突。为了解决这一问题,我们提出了一种可扩展的、仅需推理的数据估值流程,该流程在不进行迭代模型重训练的情况下近似计算夏普利值(Shapley value)。通过将语义k-近邻(k-NN)邻域映射为有向图,我们的框架直接利用参考LLM的概率分布,通过零样本和单样本条件对数似然偏移来评估数据效用。然后,我们的流程将这些预测影响力分数转化为局部优势指标,以隔离梯度冲突的记录。我们展示了该流程在清理两个经过严格审查的对齐数据集中的有效性。首先,将我们的流程应用于HelpSteer2数据集,将人工审计搜索空间减少了99.1%,成功发现了涵盖多种失败模式的错误标注记录,包括事实性幻觉、格式约束被忽略以及浅层性偏见。其次,将我们的自动化审计策略应用于Anthropic的HH-RLHF训练集和评估集,识别出数千个隐藏的安全性和事实性偏好反转。关键的是,通过将审计扩展到评估集,我们暴露了当前基准测试完整性的严重漏洞:性能强大的模型经常预测出更安全或更有帮助的回复,却受到客观上存在缺陷的人工标注标签的惩罚。总体而言,我们的工作提供了一种数学基础坚实、高度高效的诊断工具,用于发现标注错误、清理评估基准测试,并确保LLM对齐数据的完整性。

## 1 引言

大语言模型(LLM)的进步严重依赖于训练和评估数据的质量。随着模型能力不断增强,对齐的瓶颈已从模型架构转向数据质量保障[6, 26]。然而,海量的偏好数据、指令微调语料库和人工标注数据不可避免地积累了噪声、冗余和结构性矛盾,这使得可扩展的数据估值方法变得至关重要。当前数据集审计的方法主要依赖于直接的语义去重[1, 9]、LLM-as-a-judge [4]或计算成本高昂的人工重标注[26]。标准的语义去重方法能够有效识别文本重复,但无法捕捉数据点在训练或评估中的功能效用。为了克服这一局限性,研究人员转向依赖人类专家或LLM进行重标注。然而,人工标注在计算和经济上都缺乏可扩展性,并且还会受到潜在疲劳和主观偏见的影响。虽然部署更大的LLM作为评判者提供了可扩展性,但它依赖于人类定义的评估标准,并且通常会对回复长度或特定格式表现出偏见[19, 25]。LLM评判者无法确定一条训练记录的真实功能价值,也无法具体说明一条记录将如何数学上影响模型的预测分布。一种数学上严谨的替代方案是使用数据夏普利值(Data Shapley)[14, 5]来评估数据贡献。虽然有效,但原始的夏普利计算复杂度为O(2^N)。现有的近似方法要么无法扩展到生成式LLM [7, 23],要么需要粗略分组[22, 15],从而牺牲了单个记录级别的粒度。为了弥合这一差距,我们提出了一种基于影响力的数据估值流程,旨在直接通过目标LLM自身的预测分布来量化数据效用,而无需重训练或迭代数据采样。我们的方法旨在用计算上可行的替代方案来近似单个数据实例的夏普利值:通过上下文探针进行零样本和单样本影响力评分。通过测量将语义相邻的记录作为上下文示例包含在内如何改变目标回复的条件对数似然,我们的流程从数学上捕捉了一条数据点是帮助还是削弱了模型从其邻居中学习的能力。本工作的核心贡献如下:
- •**基于影响力的估值框架:** 我们引入了一种高度可扩展的、仅需推理的流程,用于近似生成式LLM的夏普利值。我们的框架不依赖于计算上禁止的模型重训练,而是通过O(K)次前向传播来评估数据贡献,其中K是语义邻域的大小。此外,与先前局限于分类或回归任务的夏普利近似不同,我们的方法泛化到评估开放式文本生成任务和成对偏好数据。
- •**结构性矛盾检测:** 我们的流程揭示了广泛使用的数据集HelpSteer2 [20]和Anthropic的HH-RLHF [2]中隐藏的结构性矛盾,这些矛盾是标准相似性度量无法发现的。我们表明,被人类评为高分的记录经常隐藏着会降低模型性能的结构性错误。这提供了一种数学基础坚实的工具,用于清理训练语料库和验证评估基准的完整性。
- •**暴露通用基准测试漏洞:** 通过对Anthropic的HH-RLHF [2]评估集进行审计,我们证明,对于我们的流程识别出的异常情况,性能强大的模型常常无法预测出正确的行为。这表明我们的工具成功识别出了高度模糊或不一致的、不公平地惩罚了良好对齐模型的人工标签,精确定位了需要专家审计和重新标注的具体记录。

## 2 相关工作

数据夏普利值[14, 5]为数据估值提供了一个原则性框架,但其精确的O(2^N)复杂度使得它无法应用于大型数据集。Jia等人[7]的一项重大突破证明了无权重K近邻(KNN)模型的精确夏普利值可以在O(N log N)时间内递归计算。在此基础上,最近的研究利用诸如基于阈值的邻域分解[23]和Wasserstein距离[11]等技术来进一步加速归因。虽然这些方法实现了严格的逐点归因,但它们将效用严格定义为空间距离和标签匹配,这限制了它们对标准回归或分类任务的适用性,而非生成式LLM的运作机制。

将夏普利值应用于LLM训练引入了新的挑战。Cluster Shapley [22]评估的是粗略的语义组而非单个记录,通过牺牲记录级别的粒度来减少数学搜索空间。其他方法,例如Tamnie等人[15]最近的工作,通过语言模型算术解决了数据源的估值问题,避免了数千次的重训练循环。但他们的方法评估的是整个数据集的贡献,并且仍然需要对每个单独的数据源进行一次微调。另一个极端是,词元级别的归因算法[21, 8]提供了深度可解释性,但在计算上与记录级别的数据集审计不匹配。目前,没有一种方法能够在不要求模型重训练或聚类的情况下,为生成式LLM提供逐点的、记录级别的夏普利近似。我们提出的流程通过测量零样本和单样本上下文探针之间的条件对数似然偏移来近似边际贡献,从而填补了这一空白。这种仅需推理的方法使我们能够保持Cluster Shapley [22]所失去的记录级别粒度,完全避免了模型算术解决方案[15]所需的参数更新,并且可以扩展到复杂的生成任务和多轮基于人类反馈的强化学习(RLHF)[12]偏好矛盾。

## 3 方法

参阅图注
图1:提出的基于影响力的数据估值流程的工作流。阶段1构建语义邻域的有向图,并通过仅推理的条件对数似然偏移来测量记录之间的预测影响力。阶段2将这些原始预测偏移转化为可操作的指标,以隔离结构性矛盾,然后由专家评估员进行仲裁,以清理数据集和基准。

夏普利值的核心原则是通过比较数据点被包含与被排除时的结果,来衡量该点对整体模型性能的边际贡献[14, 5]。为了在现代LLM的规模上近似夏普利值,我们引入了一个可处理的代理方法,利用零样本和单样本上下文探针。通过数学上评估提示中相邻记录的存在如何改变目标回复的条件对数似然,我们以最小的计算开销来衡量一个数据点的边际性能影响。如图1所示,我们的数据估值流程包含8个步骤,可以概念性地分为两个主要阶段:(1) 邻域构建与影响力测量(3.1–3.3节),在这个阶段我们构建语义邻域并计算对数似然偏移;(2) 指标推导与数据集清理(3.4–3.5节),在这个阶段我们将这些原始分数转化为可操作效用指标,以识别矛盾并隔离错误记录。

### 3.1 语义邻域构建

为了识别数据集内的语义邻居,我们首先将所有查询映射到一个稠密向量空间。给定一个由提示-回复对组成的数据集D={ (x_i, y_i) }_{i=1}^N,我们提取提示x_i或用于多轮数据的共享对话上下文。由于稠密嵌入对词元分布高度敏感,我们应用了一个特定于数据集的预处理步骤。具体来说,我们剥离样板模板或静态系统指令,以防止向量稀释。我们使用一个稠密嵌入模型对这些归一化的提示生成嵌入,并基于余弦相似度为每个提示提取其k个最近邻(k-NN)。

### 3.2 零样本和单样本影响力评分

为了量化语义邻居的预测影响力,我们测量它在一个目标回复上引起的条件对数似然偏移。我们将由θ参数化的目标LLM定义为特定的语言模型,我们旨在评估或对齐其预测概率景观,通常是用于下游对齐或评估的基础模型。给定一个目标记录(x_i, y_i)和一个检索到的邻居(x_j, y_j),我们利用目标LLM来计算对数似然偏移。目标回复序列y_i仅基于其原始提示x_i的条件对数似然基准值计算如下:
LL_base(i) = log P(y_i | x_i; θ) = ∑_{t=1}^{|y_i|} log P(y_{i,t} | y_{i,0None否则

δ(n_i) = 0 如果 |N_out(n_i)| > 0 否则 None

δ(n_i) 在数学上近似数据夏普利值,方法是将一次样本上下文学习视为参数更新的零梯度代理,并将全局子集搜索空间截断到局部语义邻域 N_out(n_i),在该邻域内一个记录的实际预测影响力为非零。通过将联盟空间限制在语义邻域内的单样本上下文交互,δ(n_i) 在 O(K) 时间内捕捉到了夏普利边际贡献。我们在附录A中提供了与精确夏普利方程连接的理论推导。当 N_out(n_i) 为 0 时,节点 n_i 是高度独特的记录,并且自然地会被排除在数据过滤之外(我们在此对具有已确认负影响力的记录进行处理)。

为了评估一个记录相对于其直接邻居的效用,我们通过将原始分数作为局部 Z 分数进行归一化来计算优势指标。至关重要的是,这两个优势指标都是针对完全相同的局部邻居集合 S_i = N_in(n_i) ∪ {n_i} 进行归一化的。我们专门使用入度邻域来归一化两个分数,以评估一个记录相对于与其地形最相似的数据点簇的分数,从而建立一个局部的性能基线。**示例优势**,表示为 Adv_e,衡量相对冗余度:
Adv_e(n_i) = (e(n_i) - μ_e(S_i)) / σ_e(S_i)
其中 μ_e 和 σ_e 分别是 S_i 中示例分数的平均值和样本标准差。
类似地,**示例化优势**,表示为 Adv_δ,衡量相对预测贡献:
Adv_δ(n_i) = (δ(n_i) - μ_δ(S_i)) / σ_δ(S_i)
其中 μ_δ 和 σ_δ 分别是 S_i 中示例化分数的平均值和样本标准差。
**独特性分数**,表示为 O(n_i),量化结构独特性:
O(n

相似文章

通过溯源分析防范LLM代理失对齐

arXiv cs.CL

本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。

当无基准存在时:验证无真实标签的LLM安全评分比较

Hugging Face Daily Papers

本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。

SHALA-LLM: 智能处理大模型对齐中的模糊标签

arXiv cs.LG

SHALA-LLM是一个强化学习框架,使大语言模型能够直接从标注者分布中学习,并在对齐过程中动态优先处理高模糊样本,从而提升与人类标签分布的一致性及分类性能。