基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式

arXiv cs.AI 论文

摘要

本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。

arXiv:2606.03305v1 Announce Type: new 摘要:基准污染(即评估示例出现在模型训练数据中)威胁着LLM评估的有效性。虽然存在检测训练数据成员资格的统计工具,但这些工具几乎仅在受控的学术环境中得到验证:大规模、同质的预训练语料库和透明的单阶段训练流程。这些方法在实际审计场景中是否仍然可靠尚不清楚。我们确定了两种尚未充分研究的失效模式:分布偏移(当嫌疑集和验证集违反独立同分布假设时产生)和规模约束(因为基准的规模比预训练语料库小几个数量级)。我们系统评估了三种主要范式:LLM Dataset Inference、Post-Hoc Dataset Inference 和 CoDeC,涵盖来自多个系列的27个模型(包括Pythia、OLMo~2以及专门的文化和医疗LLM),规模高达27B。然后我们将分析进一步扩展到前沿产业模型。在335次评估中,仅有199次产生正确结果。LLM Dataset Inference在分布偏移下产生误报,Post-Hoc Dataset Inference在基准规模下统计功效不足,而CoDeC仅提供粗粒度的溯源信号,不足以验证单个基准分割。我们的结果揭示了受控验证与实际基准审计之间的系统性可靠性差距,表明统计检测尚无法取代透明的数据溯源。我们开源了我们的基准,以便进一步研究。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:43

# 基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
来源:https://arxiv.org/html/2606.03305
11机构:华沙国家研究所,波兰华沙
22机构:华沙理工大学,波兰华沙
Jan Dubiński,Sebastian Cygert \(✉\)

###### 摘要

基准污染(即评估样本出现在模型训练数据中)威胁着 LLM 评估的有效性。存在用于检测训练数据成员资格的统计工具,但这些工具几乎仅在受控的学术环境中得到验证:大型、同质的预训练语料库和透明的、单阶段的训练流程。这些方法在现实审计场景中是否仍然可靠尚不清楚。我们识别了两种未被充分研究的失效模式:分布偏移(当可疑集和验证集违反 IID 假设时出现)和规模约束(由于基准数据集比预训练语料库小几个数量级而产生)。我们系统评估了三种主流范式:LLM 数据集推断、事后数据集推断和 CoDeC,涵盖来自多个模型系列(包括 Pythia、OLMo 2 以及专门的文化和医疗 LLM)和多种规模(高达 27B)的 27 个模型。然后我们将分析扩展到前沿行业模型。在 335 次评估中,只有 199 次产生了正确结果。LLM 数据集推断在分布偏移下产生误报,事后数据集推断在基准规模下统计功效不足,而 CoDeC 仅提供粗粒度的来源信号,不足以验证单个基准数据分割。我们的结果揭示了受控验证与实际基准审计之间系统性的可靠性差距,并表明统计检测目前还无法取代透明的数据来源。我们开源 (https://anonymous.4open.science/r/reliability-gap-benchmark-auditing/README.md) 我们的基准以供进一步研究。

## 1 引言

参见图注 图 1:我们评估检测模型是否在基准上训练过的方法的结果总结,涵盖三个任务:任务 1 评估对有限参考数据的脆弱性 (表 1 (https://arxiv.org/html/2606.03305#S5.T1));任务 2 评估指令微调 OLMo 2 的分割级基准暴露 (表 2 (https://arxiv.org/html/2606.03305#S5.T2));任务 3 评估专门的微调后数据集,用于医疗问答和波兰语 LLM (表 3 (https://arxiv.org/html/2606.03305#S5.T3) 和 4 (https://arxiv.org/html/2606.03305#S5.T4))。计数汇总了这些表中的检测结果。总体而言,在 335 个检测挑战中,只有 199 个(近 60%)被解决,表明当前方法对于证明基准完整性而言尚不可靠。

在大规模语言模型迅速扩展的时代,模型规模和训练数据量都增加了几个数量级。这种扩展解锁了推理、数学和多领域知识的新能力,将许多公共基准的性能推向了饱和点。与此同时,基准污染已成为 LLM 评估有效性的严重威胁。当基准分割泄露到经过筛选或聚合的语料库中时,基准性能可能反映的是先前的暴露,而非真正的泛化能力。随着模型在广泛使用的基准上趋于饱和,区分推理能力和记忆已成为现代 LLM 评估的核心挑战。

现有文献通过开发用于检测训练数据的原理性统计工具来解决这个问题,包括 LLM 数据集推断 [20](https://arxiv.org/html/2606.03305#bib.bib20)、事后数据集推断 [28](https://arxiv.org/html/2606.03305#bib.bib28) 以及直接污染度量如 CoDeC [27](https://arxiv.org/html/2606.03305#bib.bib27)。然而,这些方法主要在受限的学术环境中得到验证,例如使用在 The Pile [10](https://arxiv.org/html/2606.03305#bib.bib10) 上训练的 Pythia [3](https://arxiv.org/html/2606.03305#bib.bib3) 套件,其中完全数据透明且严格的分布假设成立。学术模型套件通常依赖于在大型、同质语料库上进行相对简单的单阶段预训练,这简化了污染分析。

目前尚不清楚这些方法在更现实的场景中是否仍然可靠。在实践中,基准审计涉及数量级小于预训练语料库的评估集,以及经历多个微调后阶段(包括在精心策划的混合数据上进行指令微调)的模型。为了在学术模型套件之外研究这一点,我们的评估包括公开可用的指令微调模型(总共 26 个模型),其规模达到 270 亿参数。因此,在这项工作中,我们调查现有检测机制是否能在 "现实世界" 中有效运作。我们通过两个约束条件来定义此设置:(1) 检测目标是基准数据集,而不是大规模的预训练语料库;(2) 被审计的模型是经历过多个微调后阶段的指令微调变体。

我们的主要贡献如下。**首次对基准审计进行现实世界评估。** 我们提供了对三种最先进检测范式(LLM 数据集推断、事后数据集推断和 CoDeC)的首次系统评估,超越受控学术语料库,在现实基准审计场景中进行评估,并为此开源了我们的代码。

通过我们的广泛评估,我们发现:

1. 当前的审计方法尚不足以可靠地验证基准暴露。如图 1 (https://arxiv.org/html/2606.03305#S1.F1) 总结所示,我们的评估中正确检测结果与许多失败结果并存。
2. 在有限的数据集规模下,只有 LLM DI 有效,但仅在有利条件下。当被调查的数据集像典型基准一样小时,如果 LLM DI 能够访问真正未见且近似 IID 的参考集,它仍然可以检测到训练暴露。事后 DI 没有足够的数据来构建可靠的合成参考集,而 CoDeC 为紧密匹配的训练集和测试集分配相似的分数(第 5.1 节 (https://arxiv.org/html/2606.03305#S5.SS1))。
3. 没有方法能够可靠地判断基准的哪个分割被用于训练。在分割级审计中,LLM DI 可能将分布差异误认为训练暴露,事后 DI 仍然不稳定,而 CoDeC 无法清晰区分来自同一基准的已见和未见分割(第 5.2 节 (https://arxiv.org/html/2606.03305#S5.SS2) 和 5.5 节 (https://arxiv.org/html/2606.03305#S5.SS5))。
4. 对于专门的微调后数据集和行业模型,我们发现信号变得不稳定且难以解释。对于领域特定的微调后数据集,检测性能下降。对于行业模型,这些方法可以检测模型系列层面的差异(第 5.3 节 (https://arxiv.org/html/2606.03305#S5.SS3) 和 5.4 节 (https://arxiv.org/html/2606.03305#S5.SS4))。

这些发现提出了一些实用建议。LLM DI 仅在拥有真正未见且近似 IID 的验证集时才可用。事后 DI 似乎不太适用于标准基准大小的数据集,除非可以独立评估合成保留数据的质量。CoDeC 最好被解释为一种比较性污染指标,而不是一种认证工具。我们的结果表明,透明的数据来源仍然是基准完整性声明最可靠的基础,而统计审计则作为补充证据。

## 2 相关工作

**成员和数据集推断。** 成员推断攻击 (MIA) 研究特定记录是否属于模型训练集的一部分,通常通过利用模型在已见和未见示例上行为的系统性差异 [25](https://arxiv.org/html/2606.03305#bib.bib25)。对于大型语言模型,单样本 MIA 可能充满噪声,这推动了**数据集推断**方法的发展,这些方法在一个可疑集上聚合每个样本的弱信号,并将其与未见过的参考集进行比较 [20](https://arxiv.org/html/2606.03305#bib.bib20)。这些测试的一个关键实际挑战是获得一个真正未见过且与可疑集充分 IID 的参考集或验证集;违反这一假设可能导致混淆的检测结果。

**基准污染。** 基准污染指的是基准数据集与模型训练数据之间的重叠 [4](https://arxiv.org/html/2606.03305#bib.bib4)。当基准的训练或测试分割直接包含在预训练语料库中,或者当大型筛选混合数据中存在近似重复或高度重叠的变体时,可能会发生这种重叠 [19](https://arxiv.org/html/2606.03305#bib.bib19)。在这种情况下,基准性能可能反映的是先前的暴露,而不是对未见数据的泛化。随着基准被反复使用并越来越多地被纳入微调后混合数据中,污染变得既更可能又更难检测 [2](https://arxiv.org/html/2606.03305#bib.bib2)。

在记录污染风险的同时,最近的工作集中在开发检测污染的方法上。基于检索和基于行为的审计方法测试是否可以从候选语料库中恢复基准项,或从模型本身引出这些项 [8](https://arxiv.org/html/2606.03305#bib.bib8), [11](https://arxiv.org/html/2606.03305#bib.bib11)。更近期,基于性能的方法将污染检测视为一个统计问题,询问异常强的基准结果是否更可能由先前的暴露而不是真正的泛化来解释 [7](https://arxiv.org/html/2606.03305#bib.bib7)。另一个最近的方向是上下文污染检测:CoDeC [27](https://arxiv.org/html/2606.03305#bib.bib27) 测量从同一数据集中添加示例如何改变模型的置信度,利用这些变化产生一个可解释的数据集级污染分数。该方法仅需要灰盒访问 token 概率,并假设对训练语料库没有先验知识,这使得它对于实际的基准审计特别有吸引力。

## 3 方法

在我们的实验中,我们使用以下方法:事后数据集推断、LLM 数据集推断和 CoDeC,本节将对其进行描述。

**LLM 数据集推断。** 该方法 [20](https://arxiv.org/html/2606.03305#bib.bib20) 建立在成员推断攻击的基础上,但将分析单元从**单个样本**转向**数据集**。对于 LLM 来说,单样本 MIA 通常噪声太大而无法可靠使用:许多序列即使从未在训练中出现过也是“容易的”(低损失),并且随着模型规模的扩大,任何特定示例的成员信号都会变得微弱。

数据集推断通过**聚合跨多个样本的弱成员信号**来解决这个问题,并测试在总体上,一个**可疑集**是否比一个**未见验证集**看起来更像训练数据。具体来说,我们计算从两组样本中得到的 MIA 派生分数(例如,基于损失或困惑度及相关特征)的集合,学习这些特征的简单聚合,然后在保留样本上执行统计检验(通常是单侧 t 检验),以确定可疑集是否表现出比验证集系统性更强的成员证据。

数据集推断的输出是一个 p 值。在原假设 H0(模型未在可疑集上训练)下,观察到的可疑集与验证集之间的分离应该是由随机性造成的。小的 p 值(例如,如 [20] 中 p<0.1)被解释为反对 H0 的证据,即检测到模型在可疑数据集上训练过。重要的是,这个 p 值仅在关键假设下有意义:验证集必须在训练期间未见,并且与可疑集 IID。如果这两个集的分布不同,例如基准的训练分割与其测试分割,则检验可能被混淆并产生误报。

**事后数据集推断。** 事后 DI 旨在放宽 LLM 数据集推断对未见且 IID 验证集的实际要求。事后 DI 不是要求一个自然存在的验证集,而是构建一个合成验证集,旨在与可疑数据在分布上匹配。该过程有两个阶段。

(1) **保留数据生成。** 从给定数据集的文档语料库开始,该方法将文档分割成短片段,并将它们分成两个不相交的池。在一个池上使用因果语言建模目标训练一个小型生成器模型。第二个池被转换成前缀 - 后缀对;然后使用生成器根据前缀生成人工后缀。得到的数据集包含真实后缀(形成可疑集)和合成后缀(作为验证集)。两组都共享表面层面的分布特性,但只有可疑集可能包含被审计模型中的记忆化训练数据。

(2) **事后校准。** 该方法训练两个分类器来区分可疑示例与合成验证示例:(i) 纯文本分类器 c_text,以及 (ii) 组合分类器 c_comb,它在文本基础上增加 MIA 派生特征,如损失统计。核心统计问题是 MIA 特征是否提供了超出纯文本所能实现之外的额外可分离性。具体来说,我们计算每个示例的分类分数,并进行单侧 t 检验,以确定组合分类器相对于纯文本基线是否改善了分离。输出是在原假设 H0(一旦文本特征被考虑,MIA 特征不增加有意义信号)下的 p 值。小的 p 值,例如 p<0.1,被解释为被审计模型在可疑分布上训练过的证据。

**基于上下文的污染信号。** 作为基于似然和基于分类器的审计的补充,CoDeC(通过上下文进行污染检测)通过测量来自同一数据集的上下文示例如何影响下一个 token 的似然来检测数据集级别的污染 [27](https://arxiv.org/html/2606.03305#bib.bib27)。上下文学习通常能改善对未见数据的预测,但当记忆被触发时,它可能变得无帮助甚至有害。这产生了一个可解释的污染分数,定义为上下文示例降低模型置信度的样本比例。

关键观察是,当模型尚未内化目标分布时,上下文学习通常是有帮助的。添加几个示例提供了数据集特定的线索,如格式或词汇,并改善了下一个 token 的似然。相反,如果模型已经在数据集或其近似变体上训练过,上下文示例则几乎不提供新信息。

在操作上,对于来自数据集 D 的每个样本 x,CoDeC 比较模型在两种设置下对 x 的平均对数似然:(i) 基线设置,模型直接预测 x,以及 (ii) 上下文设置,其中 x 前面有来自 D 的少量其他样本。每个样本的分数是对数似然差 Δ(x),定义为上下文减去基线。数据集的**污染分数**是 Δ(x) < 0 的样本比例。

相似文章

审计审计:基准有效性审计的五大失效模式

arXiv cs.LG

本文识别了基于扰动的基准有效性审计中的五种失效模式,这些审计常用于AI治理。研究表明,实现细节可以悄无声息地制造结论。本文提出了一种尽职调查关口,以提高评估证据的可靠性。

当无基准存在时:验证无真实标签的LLM安全评分比较

Hugging Face Daily Papers

本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。