无影子模型或保留数据的数据集使用推断

arXiv cs.LG 论文

摘要

介绍了一种实用的数据集使用推断(DUI)框架,该框架通过合成非成员和混合比例估计,在无需影子模型或保留数据的情况下,估计用于训练生成模型的数据集比例。

arXiv:2606.26257v1 公告类型:新 摘要:我的数据有多少被用于训练机器学习模型?数据集使用推断(DUI)旨在通过估计数据集中有多大比例贡献于模型训练来回答这一问题。然而,现有的DUI方法依赖于在实践中很少成立的假设:它们需要训练昂贵的影子模型来模仿目标模型,并且假设既能访问已知的训练样本,又能访问一个确认未参与训练且与分布内一致的保留集。这些条件使得当前方法难以适用于现代大型模型和真实的数据所有权纠纷。我们提出了一种消除这些限制的实用DUI框架。我们的方法既不需要影子模型,也不需要真实的保留数据。相反,它生成合成非成员样本,提取多样的成员信号,并将DUI转化为混合比例估计问题,以估计候选数据集在训练中被使用的比例。在大型图像生成模型上的实验表明,我们的方法能够可靠地量化数据集使用情况,为数据所有者提供了一种实用工具,以确定其数据有多少被用于训练模型。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:17

# 数据集使用推断:无需影子模型或留出数据源:https://arxiv.org/html/2606.26257 Wojciech Łapacz 华沙理工大学 &Stanisław Pawlak11footnotemark:1 华沙理工大学 Jan Dubiński11footnotemark:1 华沙理工大学 NASK 国家研究机构 &Franziska Boenish CISPA 亥姆霍兹信息安全中心 &Adam Dziedzic CISPA 亥姆霍兹信息安全中心 ###### 摘要 我的数据有多少被用于训练机器学习模型?数据集使用推断(Dataset Usage Inference,DUI)旨在通过估计数据集中有多大比例贡献于模型训练来回答这一问题。然而,现有的 DUI 方法依赖于实践中很少成立的假设:它们需要训练昂贵的影子模型来模仿目标模型,并且假设能够访问已知的训练样本和一个确认为未参与训练的同分布留出集。这些条件使得当前方法对于现代大模型和真实数据所有权争议难以实用。我们提出了一种实用的 DUI 框架,消除了这些约束。我们的方法既不需要影子模型,也不需要真实的留出数据。相反,它生成合成的非成员样本,提取多样化的成员信号,并将 DUI 转化为混合比例估计问题,以估计候选数据集中有多大比例被用于训练。在大型图像生成模型上的实验表明,我们的方法能够可靠地量化数据集使用情况,为数据所有者提供一种实用工具,以确定他们的数据有多少被用于训练模型。 ## 1 引言 随着大型生成模型的兴起,哪些数据被用于训练已成为一个重大的法律和伦理问题。这已不再是纯粹的技术问题:它对版权、同意和问责制有直接影响,正如正在进行的争议所示,例如《纽约时报》起诉 OpenAI[44 (https://arxiv.org/html/2606.26257#bib.bib13)] 或 Getty Images 诉 Stability AI[18 (https://arxiv.org/html/2606.26257#bib.bib2)]。这些发展凸显了对能够可靠检查特定数据集是否被用于训练生成模型的方法的明确需求。作为回应,研究人员探索了训练数据检测的几个方向。一条工作线是对潜在训练数据加水印,或对训练后的模型植入后门,使训练留下可检测的痕迹[28 (https://arxiv.org/html/2606.26257#bib.bib16),27 (https://arxiv.org/html/2606.26257#bib.bib17),42 (https://arxiv.org/html/2606.26257#bib.bib18),26 (https://arxiv.org/html/2606.26257#bib.bib19)];这需要在训练前进行干预,因此对大多数第三方审计者不可用。第二条线,成员推理攻击(Membership Inference Attacks,MIAs),则事后操作,询问某个特定样本是否属于训练集,利用模型在训练中见过的样本与未见过的样本上行为不同的现象[20 (https://arxiv.org/html/2606.26257#bib.bib22)]。然而,对于现代大型生成模型,每个样本的成员信号通常较弱,且对成员与非成员数据之间的分布偏移敏感,大多数现有的 MIA 在无偏基准测试上退化为近乎随机的性能[30 (https://arxiv.org/html/2606.26257#bib.bib438),10 (https://arxiv.org/html/2606.26257#bib.bib357)]。数据集推断(Dataset Inference,DI)攻击通过聚合多个样本的成员证据来获得更强的数据集级信号,从而解决了这一弱点[32 (https://arxiv.org/html/2606.26257#bib.bib100)]。尽管 DI 方法提供了数据集使用的有用证据,但它们解决的是二元问题:数据集是否被用于训练?在实践中,这种二元视图是不够的。法律框架和真实世界的数据所有权争议需要量化使用的程度。例如,美国版权法第 107 条[47 (https://arxiv.org/html/2606.26257#bib.bib29)] 要求合理使用分析考虑“使用部分相对于版权作品的数量和实质性”。因此,一个实用的数据集审计不仅需要检测数据集是否被使用,还需要估计其中有多大比例被使用。

参看图注:图 1:NU-DUI 概述。给定一个嫌疑集,我们使用 Stable Diffusion img2img 生成一个合成非成员参考集,并使用相同的自动编码器对嫌疑集进行自动编码,以减少分布偏移。然后,我们在两个集上查询目标模型,提取 MIA 特征,并应用混合比例估计推断嫌疑集中有多大比例被用于训练。

Tong 等人 [46 (https://arxiv.org/html/2606.26257#bib.bib28)] 形式化了这个问题并提出了 DUCI,该方法使用去偏 MIA 来估计训练过程中使用的数据集比例。然而,他们的方法基于两个在实践中很少成立的假设。首先,它需要训练昂贵的影子模型,这些模型紧密模仿目标模型的架构和行为;对于现代大规模生成模型,这在计算上不可行:单个用于 1.5B 参数图像自回归目标的影子模型已经需要超过 1500 个 A100 小时,而典型的五个影子设置会进一步增加。其次,它假设能够访问一个同分布的留出集,该集合被确认排除在训练之外;在实际争议中,这种可信的留出数据很少可用。为了解决这些限制,我们提出了负无标签数据集使用推断(Negative Unlabeled Dataset Usage Inference,NU-DUI),这是一个实用的框架,既不需要影子模型,也不需要真实的留出集。给定一个嫌疑集,NU-DUI (i) 通过使用与被审计模型不同家族的生成器进行图像到图像释义来构建合成非成员参考,这防止合成集位于目标损失的固定点;(ii) 使用与释义过程中相同的自动编码器对嫌疑集进行自动编码,从而使比较的双方共享相同的生成器伪影,残余分布偏移主要由成员身份主导;(iii) 提取针对目标模型家族定制的 MIA 特征向量;(iv) 应用混合比例估计来恢复单个估计的成员比例 p̂。该方法仅需待检查的数据集,因此轻量且适用于现代大型生成模型。实验上,NU-DUI 在五个大型图像生成模型(包括扩散和自回归模型)上产生了准确的成员比例估计,而无需训练任何影子模型。对于 RAR-XXL[51 (https://arxiv.org/html/2606.26257#bib.bib441)] 和包含 1000 张图像的嫌疑集,完整的 NU-DUI 流程大约需要 42.5 个 A100 分钟,而执行 DUCI 使用单个影子模型处理同一目标则需要超过 1500 个 A100 小时:加速超过 2000 倍。使用自动编码后的嫌疑集,在大多数目标模型上平均估计误差远低于 0.1(例如,在 RAR-XXL 上使用基于 PUL 的 MPE 时 MAE=0.058),缩小了与需要可信留出非成员集的理想设置之间的大部分差距。总之,我们的主要贡献是:
- • 我们将数据集使用推断重新定义为混合比例估计问题,消除了对昂贵影子模型的需求。
- • 我们提出生成逼真的合成非成员样本并对嫌疑集进行自动编码,消除了对实践中很少可用的可信真实留出集的依赖。
- • 我们通过实验证明,NU-DUI 在五个大规模自回归和扩散图像生成器上产生了准确的成员比例估计,计算量比基于影子模型的 DUCI 低数个数量级,为现代生成模型解锁了数据集使用推断。

## 2 背景与相关工作
本节回顾 NU-DUI 所基于的三条工作线:成员推理攻击、数据集推断和混合比例估计。

#### 成员推理攻击。
成员推理攻击(MIAs)旨在确定某个特定数据点是否包含在模型的训练集中。它们通常利用过拟合:模型在训练期间见过的样本与未见过的样本上,行为往往系统性不同。在大型语言模型(LLMs)中,MIA 通常依赖基于似然的信号,例如 token 级损失 [50 (https://arxiv.org/html/2606.26257#bib.bib237)]、异常自信的 token 预测 [40 (https://arxiv.org/html/2606.26257#bib.bib386)],或似然比检验的组合 [52 (https://arxiv.org/html/2606.26257#bib.bib191)]。Kowalczuk 等人 [25 (https://arxiv.org/html/2606.26257#bib.bib356)] 将这些思想扩展到图像自回归模型(IARs),证明为 LLMs 开发的攻击可以迁移到自回归图像生成器。对于扩散模型,MIA 通常通过选定时间步的噪声预测误差来估计成员身份。SecMI[9 (https://arxiv.org/html/2606.26257#bib.bib173)] 比较采样和逆采样轨迹之间的误差,PIA[24 (https://arxiv.org/html/2606.26257#bib.bib334)] 对比干净和加噪输入上的预测,CLiD[53 (https://arxiv.org/html/2606.26257#bib.bib336)] 通过条件似然中的差异来测量成员身份。然而,一个反复出现的发现是,MIA 对成员与非成员数据之间的分布偏移高度敏感。在大型现代模型的无偏基准测试中,大多数现有攻击大幅退化,通常仅略高于随机猜测 [30 (https://arxiv.org/html/2606.26257#bib.bib438),10 (https://arxiv.org/html/2606.26257#bib.bib357)]。这促使我们聚合多个样本的成员证据,而不是依赖单个样本的决策。

#### 数据集推断。
数据集推断(DI)[32 (https://arxiv.org/html/2606.26257#bib.bib100)] 旨在确定某个特定数据集是否包含在模型的训练集中。与在单个样本上操作的 MIA 不同,DI 聚合多个点的成员信号以获得数据集级的决策。形式上,给定一个目标模型 f 和一个嫌疑数据集 D_sus,DI 通过将其在 D_sus 上的成员信号与来自同分布留出数据集 D_val 上的信号进行比较,来测试 f 是否在 D_sus 上训练过。一般的 DI 流程包括三个步骤:(1) 从 D_sus 和 D_val 中的样本中提取成员特征;(2) 将这些特征聚合成数据集级分数;(3) 应用统计检验比较两组之间的分数。成员特征的选择取决于学习范式,范围从监督模型中的决策边界信号 [32 (https://arxiv.org/html/2606.26257#bib.bib100)] 到自监督设置中的表示统计量 [12 (https://arxiv.org/html/2606.26257#bib.bib323)]。现代针对生成模型的 DI 方法,包括 LLM[31 (https://arxiv.org/html/2606.26257#bib.bib190)]、扩散模型 [10 (https://arxiv.org/html/2606.26257#bib.bib357)] 和图像自回归模型 [25 (https://arxiv.org/html/2606.26257#bib.bib356)],都遵循这一模板:它们使用针对特定模型家族设计的 MIA 提取成员特征,并将其聚合成训练使用的数据集级指标。然而,DI 仍然回答一个二元问题;它不量化 D_sus 中实际使用了多少。

#### 混合比例估计。
混合比例估计(MPE)是在无标签数据集中识别正例比例 α 的任务,这是正无标签学习(PUL)的核心问题 [29 (https://arxiv.org/html/2606.26257#bib.bib374)]。Blanchard 等人 [3 (https://arxiv.org/html/2606.26257#bib.bib11)] 和 Scott [39 (https://arxiv.org/html/2606.26257#bib.bib10)] 的早期理论基础建立了可识别性所需的不可约条件,但他们的初始估计器通常计算上不可行。随后出现了实用估计器:Elkan 和 Noto [13 (https://arxiv.org/html/2606.26257#bib.bib366)] 提出利用正例与无标签分类器,Plessis 等人 [33 (https://arxiv.org/html/2606.26257#bib.bib375)] 使用 Pearson 散度最小化;然而,两者通常依赖于正分布与负分布之间不相交支持的限制性假设。Ramaswamy 等人 [35 (https://arxiv.org/html/2606.26257#bib.bib7)] 引入了 KM 算法,通过将分布嵌入到再生核希尔伯特空间中,提供了第一个具有收敛保证的计算可行方法,尽管在高维设置中扩展性差。基于树的方法如 TIcE[1 (https://arxiv.org/html/2606.26257#bib.bib367)] 划分特征空间以识别正例出现率高于整体混合的区域,但在复杂特征上可能变得不可靠。基于分类器的启发式方法如 AlphaMax[22 (https://arxiv.org/html/2606.26257#bib.bib9)] 和 DEDPUL[21 (https://arxiv.org/html/2606.26257#bib.bib8)] 将正例与无标签分类器视为降维工具,并从由此产生的一维分数中估计 α;它们效率高,但往往强烈依赖于分类器质量。MPE 也可以框架化为基于直方图的估计,其中训练好的 PU 分类器 [2 (https://arxiv.org/html/2606.26257#bib.bib368),19 (https://arxiv.org/html/2606.26257#bib.bib369),43 (https://arxiv.org/html/2606.26257#bib.bib371)] 的输出被分箱,以估计无标签混合中的正类似然。我们的工作将 MPE 用作模块化工具,利用在“完全随机选择”(SCAR)假设下,MPE 提供了类别先验的下界这一事实。

## 3 方法
我们估计一个嫌疑集 X^real 中被用于训练目标生成模型 M 的样本比例 p。嫌疑集可能包含成员和非成员,我们假设在推理时只能访问 X^real 和 M:无影子模型,也无可信的留出非成员集。我们的流程(算法 1 (https://arxiv.org/html/2606.26257#alg1))包含三个阶段:(i) 构建一个合成非成员参考集 X^img2img_nonmember,以及嫌疑集的自动编码版本 X^AE,两者旨在限制成员侧和非成员侧数据之间的分布偏移;(ii) 使用针对目标模型家族定制的攻击,从两个集中提取成员推理(MIA)特征;(iii) 对得到的特征应用混合比例估计(MPE)来估计 p。

算法 1 负无标签数据集使用推断
1: 嫌疑集 X^real;特征提取器 Φ_MIA
2: 通过对 X^real 进行图像到图像释义构建 X^img2img_nonmember
3: 通过对 X^real 进行自动编码构建 X^AE
4: U ← X^AE  ▷ 无标签
5: N ← X^img2img_nonmember  ▷ 合成负例
6: Z^MIA = Φ_MIA(U ∪ N)
7: p̂ ← MPE(Z^MIA, U, N)
8: 返回 p̂

#### 合成留出集的生成
数据集使用推断中的一个核心障碍是缺少一个已知仅包含非成员的受信任留出集。

相似文章

专有数据集保护的水印技术

arXiv cs.LG

本文提出利用水印技术保护专有数据集,防止其被未经授权用于训练生成模型,并证明在特定条件下,基于水印的数据集推理可以达到与传统基于损失的方法相当的成员检测性能。

用于监测和分类研究文献中数据使用的AI

arXiv cs.CL

本文提出了一种基于多任务GLiNER的框架,用于可扩展地监测研究文献中的数据集使用情况。该框架利用合成数据生成和基于LLM的重新验证,以解决提取、关系识别和使用分类中的挑战。

MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补

arXiv cs.LG

提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。

UniGD:一种用于工业检索的统一生成-判别框架

arXiv cs.AI

快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。

GUIDE: 生成式效用推理与决策引擎

arXiv cs.LG

GUIDE是一个LLM驱动的架构,用于偏好诱导,它使用贝叶斯自适应采样和符号学习来推断人工智能对齐中的用户偏好,从而提高冷启动性能并减少推荐遗憾。