多大型语言模型基准测试的可证明联合去污

arXiv cs.LG 论文

摘要

提出联合包络符合选择(JECS),一种用于多模型基准去污的符合程序,可证明地控制全局污染率,同时保持比基线更高的统计功效。

arXiv:2605.21543v1 公告类型:新 摘要:基准数据污染已成为大型语言模型评估中的核心挑战:当评估示例出现在一个或多个被审计模型的训练数据中时,报告的性能可能被夸大,跨模型比较变得不可靠。大量训练数据检测工作设计分数来量化模型对给定数据点的记忆强度,但这些基于分数的方法缺乏理论保证。最近的符合方法为单个模型提供了可证明的误识别控制;然而,将它们分别应用于每个模型可能会产生特定于模型的基准,从而破坏跨模型的公平比较。在这项工作中,我们将多模型基准去污形式化为一个联合选择问题,并提出联合包络符合选择(JECS),一种符合程序,能够在既定假设下实现全局污染率(GCR)控制。具体来说,JECS计算每个模型的符合p值,通过每个项目的最大值进行聚合,并从数据驱动阈值以上的右尾观测中重建最大p空分布的保守包络。通过将自适应Benjamini-Hochberg(BH)程序应用于包络重新缩放的值,我们选择了一个具有可证明GCR控制的基准。在各种模型和基准上的大量实验表明,JECS实现了比最大p基线更高的统计功效,同时持续保持目标GCR控制。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:48

# 可证明的联合去污染:面向多个大语言模型的基准测试基准构建  
**来源:** https://arxiv.org/html/2605.21543  

Zhenlong Liu  
统计与数据科学系,南方科技大学  
上海创新研究院  

Hongxin Wei  
统计与数据科学系,南方科技大学  

###### 摘要  
基准数据污染已成为大语言模型评估中的核心挑战:当评估样本出现在一个或多个被审计模型的训练数据中时,报告的性能可能被夸大,跨模型对比变得不可靠。大量训练数据检测工作设计了评分来量化模型对给定数据点的记忆强度,但这些基于评分的方法缺乏理论保证。近期符合推断方法为*单个模型*提供了可证明的误识别控制;然而,将这些方法分别应用于每个模型会产生模型特定的基准,从而破坏跨模型的公平比较。在本工作中,我们将多模型基准去污染形式化为一个联合选择问题,并提出 Joint Envelope Conformal Selection (JECS),一种符合推断程序,能够在给定假设下实现对全局污染率 (GCR) 的控制。具体地,JECS 计算每个模型的符合 p 值,通过每个项的最大值进行聚合,并从高于数据驱动阈值的右尾观测中重建最大 p 零分布的保守包络。通过对包络缩放后的值应用自适应 Benjamini–Hochberg (BH) 程序,我们选择一个具有可证明 GCR 控制的基准。跨多种模型和基准的大量实验表明,JECS 在持续维持目标 GCR 控制的同时,实现了比最大 p 基线更高的统计功效。  

## 1 引言  
大语言模型 (LLM) 的显著成就很大程度上得益于其预训练语料库的规模和多样性 (Kaplan et al., 2020; Chang et al., 2024)。然而,大规模预训练语料库的构建可能导致训练数据与评估基准之间发生重叠,这种现象通常被称为基准数据污染 (Sainz et al., 2023; Deng et al., 2024; Xu et al., 2024; Balloccu et al., 2024)。这种重叠可能夸大报告的性能,模糊模型是否真正泛化到训练数据之外的能力,并削弱基于基准的评估的可信度。这凸显了为多个被审计模型构建一个去污染基准的必要性。  

为了解决这个问题,大量工作 (Carlini et al., 2021; Zhang et al., 2025b; Li et al., 2024c) 设计了检测评分,例如 Min-K% (Shi et al., 2024),以量化模型对给定数据点的记忆强度。由于这些基于评分的方法缺乏理论保证,近期工作 (Liu et al., 2026) 利用符合推断来识别单个模型的训练数据,并具有可证明的误识别控制。然而,将这样的程序分别应用于每个模型会产生模型特定的基准,从而破坏跨模型的公平比较。在实际的基准评估中,审计者需要一个共享的去污染基准,以支持跨多个模型的公平评估。这促使我们开发方法来选择*一个*共享基准,并在所有被审计模型中控制污染率。  

在本文中,我们将联合基准去污染形式化为一个联合选择问题,其目标是选择一个单一的基准,该基准相对于多个被审计模型是去污染的。具体来说,如果一个样本没有出现在任何被审计模型的训练数据中,我们称其为*联合纯净的*,并定义全局污染率 (GCR) 为所选集合中受污染样本的期望比例。为了控制 GCR,我们提出 Joint Envelope Conformal Selection (JECS),它首先通过取每个候选样本在各模型上的符合 p 值的最大值,在联合零假设下获得一个有效的 p 值。为了恢复统计功效,我们进一步重建最大 p 零分布的累积分布函数 (CDF) 的保守包络函数,将每个最大 p 值通过拟合函数映射,然后应用自适应 BH 程序 (Benjamini and Hochberg, 1995; Benjamini and Yekutieli, 2001)。我们建立了理论保证,表明 JECS 可以在用户指定的水平 α 上控制污染率。在模拟数据和真实 LLM 基准上的广泛实验证明了 JECS 在联合基准去污染中的有效性。在所有设置中,JECS 都将全局污染率控制在用户指定的目标内,而无论是 per-model 符合选择结果的并集还是交集都无法做到。例如,在 α=0.1 的合成设置下,JECS 达到 GCR=0.038,而并集和交集规则分别以 GCR=0.763 和 0.366 违反了目标。此外,我们的方法比最大 p 基线提高了统计功效。例如,在 ArXivTection 上使用 Pythia-6.9B (Biderman et al., 2023) 和 Min-K%++ 评分 (Zhang et al., 2025b) 且 α=0.1 时,我们的方法将功效从 0.094 提高到 0.447。总体而言,这些结果表明 JECS 在保持联合选择所需的污染率控制的同时,恢复了由保守的最大 p 基线所损失的大部分统计功效。  

我们将贡献总结如下:  
1. 我们将多模型基准去污染形式化为一个联合选择问题,其中候选项只有在每个被审计模型的训练数据中都未出现时才是联合纯净的。我们引入全局污染率 (GCR) 作为选择跨多个被审计模型的共享基准的污染率标准。  
2. 我们提出 Joint Envelope Conformal Selection (JECS),一种用于构建跨多个被审计模型的共享去污染基准的联合选择程序。具体地,JECS 缓解了有效最大 p 基线的超均匀保守性,从而在保持全局污染率控制的同时显著提高统计功效。  
3. 我们建立了理论保证,表明 JECS 在给定条件下控制 GCR。我们通过广泛实验进一步验证了这些保证,展示了 JECS 在模拟数据和真实世界 LLM 基准上的有效性。  

## 2 预备知识  
#### 设定。  
令 θ 为一个在私有语料库 D_train(θ) 上训练的目标语言模型,并令 X 表示 token 序列的输入空间。对于样本 x∈X,二元成员指示符 M(x;θ)=1{x∈D_train(θ)}∈{0,1} (1) 记录 x 是否用于训练 θ。具体来说,M=1 表示成员,M=0 表示非成员。在整篇论文中,我们审计 K 个这样的模型 {θ_k}_{k=1}^K 在候选池 {x_i}_{i=1}^n 上,并记 M_i^k=M(x_i;θ_k) 为候选实例 i 在模型 θ_k 下的成员状态。  

#### 训练数据检测。  
训练数据检测,也称为成员推断攻击 (MIA),旨在通过查询访问模型 p_θ 来推断成员指示符 M(x;θ)。标准流程为每个样本分配一个检测评分 T(x;θ),并通过水平集规则预测成员身份,不等式方向由评分惯例决定。在本文中,我们规定 T 的较小值提供更强的非成员证据,因此阈值规则可以写为 M^=1{T(x;θ)≥τ},其中阈值 τ 由验证集决定 (Shokri et al., 2017; Ye et al., 2022)。一个代表性的评分是 Min-K%++ (Zhang et al., 2025b),对于序列 x=(t_1,...,t_L),它取最低 K% token 上标准化对数概率的平均值:  
T_Min-K%++(x;θ) = (1/|I|) ∑_{ℓ∈I} (log p_θ(t_ℓ|t_<ℓ) - μ_ℓ)/σ_ℓ,   μ_ℓ = E_{t~p_θ(·|t_<ℓ)}[log p_θ(t|t_<ℓ)],   (2)  
其中 σ_ℓ 是 log p_θ(·|t_<ℓ) 在下一个 token 分布下的标准差,I⊂{1,...,L} 是按每个 token 对数概率最低的 K% token 的索引。其他广泛使用的评分包括 perplexity (Carlini et al., 2021)、Min-K% (Shi et al., 2024) 和 Modified Entropy (Song and Mittal, 2021)。这些评分为特定模型的记忆提供了有用的逐实例证据,但它们不提供对预测结果的理论保证。  

#### 用于训练数据识别的符合推断。  
为了提供可证明的证据,近期工作 (Liu et al., 2026) 将训练数据识别形式化为一个多重假设检验问题。对于每个被审计模型 θ_k,模型特定的零假设和备择假设为:  
H_0,i^k: x_i ∈ D_train(θ_k),   H_1,i^k: x_i ∉ D_train(θ_k).   (3)  
拒绝 H_0,i^k 意味着 x_i 被识别为相对于 θ_k 是纯净的;误识别发生在受污染项被错误选择时。符合 p 值 (Vovk et al., 2003, 2005) 将检测评分校准为有效的 p 值:  
p_i^k = (1 + ∑_{x_ℓ∈D_cal} 1{T(x_ℓ;θ_k) ≤ T(x_i;θ_k)}) / (|D_cal|+1),   (4)  
其中 D_cal 是已知属于 θ_k 成员的校准集,从与受污染候选相同的协变量分布中抽取。然后使用 Benjamini–Hochberg (BH) 程序 (Benjamini and Hochberg, 1995) 选择一个子集:  
S_k = {i: p_i^k ≤ α r^* / n}, 其中 r^* = max{r∈{1,...,n}: p_(r)^k ≤ α r / n},   (5)  
这里 p_(1)^k ≤ ... ≤ p_(n)^k 是排序后的模型特定 p 值。在原始的训练数据识别设定中,先前工作 (Bates et al., 2023; Liu et al., 2026) 表明,在被识别为成员的项中,θ_k 非成员的期望比例可以在用户指定的水平 α∈(0,1) 上得到控制。然而,这种保证是模型特定的:将程序分别应用于不同的被审计模型会得到不同的选择子集 S_1,...,S_K。在实际的基准评估中,审计者需要一个单一的去污染基准以在所有被审计模型之间进行公平比较。这一差距促使我们研究接下来讨论的联合基准去污染问题。  

## 3 联合基准去污染  
### 3.1 问题形式化  
我们将**联合基准去污染**问题形式化,其目标是选择一个共享的基准,该基准相对于所有被审计模型都是去污染的。与上述模型特定设定不同,此问题中的污染是跨被审计模型集合全局定义的。实例 x_i 如果出现在至少一个被审计模型的训练数据中,则是*受污染的*;只有出现在所有模型的训练数据中都没有时,才被认为是*联合纯净的*。相应地,联合零假设和备择假设为:  
H_0,i: ∃ k^*∈{1,...,K}, x_i ∈ D_train(θ_k^*),   H_1,i: ∀ k, x_i ∉ D_train(θ_k).   (6)  
拒绝 H_0,i 表明 x_i 被推断为联合纯净的,因此被选入基准。因此,我们通过所选基准内的污染率来量化误差。形式化地,对于所选集合 S ⊆ {1,...,n},我们定义全局污染比例 (GCP) 和全局污染率 (GCR) 如下:  
GCP(S) = ∑_{i=1}^n 1{i∈S, H_0,i is true} / (1 ∨ |S|),   GCR(S) = E[GCP(S)],   (7)  
其中我们记 a ∨ b = max{a,b}。我们的目标是返回一个子集 S,使得 GCR(S) ≤ α,其中 α∈(0,1) 是用户指定的水平。除了 GCR 控制外,我们还寻求一种尽可能多地选择真实候选项的程序。为了量化这一目标,我们定义**统计功效**为:  
Power(S) = E[ (∑_{i=1}^n 1{i∈S, H_1,i is true}) / (1 ∨ ∑_{i=1}^n 1{H_1,i is true}) ].   (8)  
理想的方法应在给定水平 α 上控制 GCR,并尽可能具有高功效。  

#### 朴素 per-model 组合无法控制 GCR。  
表 1:合成数据上朴素 per-model 组合的实际 GCP。标有 † 的条目超过 α,表明未能满足 GCR 目标。  
一种自然但无效的方法是先为每个模型分别应用符合推断程序(例如,使用 BH 程序控制每个模型的误识别率),然后取所得子集的并集或交集。并集规则选择在至少一个模型上被识别为纯净的项,这样可能会包含受污染项(即,该模型上的纯净项,但被其他模型记忆)。相反,交集规则选择在所有模型上都被识别为纯净的项,这虽然能确保联合纯度,但可能会过于保守,遗漏许多真正的联合纯净项。此外,这两种组合程序都无法提供对 GCR 的式控制,因为它们忽略了模型间依赖性和每个模型选择水平的选择。

相似文章

Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准

arXiv cs.CL

本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。