专有数据集保护的水印技术

arXiv cs.LG 论文

摘要

本文提出利用水印技术保护专有数据集,防止其被未经授权用于训练生成模型,并证明在特定条件下,基于水印的数据集推理可以达到与传统基于损失的方法相当的成员检测性能。

arXiv:2607.00325v1 公告类型:新 摘要:越来越多文献表明,在现代语言建模环境中,训练数据成员推理问题本质上是困难的任务。基于先前的研究结果(语言模型在部分加水印的训练数据集下会表现出残留水印“放射性”),我们认为输出水印技术是使生成模型的训练成员测试更加可行的合适工具。我们将基于水印的数据集推理方法与传统的基于损失的成员推理方法进行正面比较,并证明在替代假设条件下,当子集暴露足够高时,水印技术可以达到相当的成员检测性能。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:37

# 专有数据集保护的水印技术 来源:https://arxiv.org/html/2607.00325

###### 摘要

越来越多的文献表明,在现代语言建模设置中,训练数据成员推断问题本质上是一项困难任务。我们认为,基于先前研究表明语言模型在部分水印训练数据集下会残留水印“放射活性”,输出水印技术是使生成模型的训练成员测试更易处理的正确工具。我们将基于水印的数据集推断方法与传统的基于损失的成员推断方法进行正面比较,并表明当子集暴露程度足够高时,在一组替代假设下,水印技术可以实现可比较的成员检测性能。

## 1 引言

现代语言模型执行着日益具有经济价值的复杂知识工作,但规范其训练所用网络爬取数据合理使用的监管框架仍不完善。最近的诉讼表明,新闻网站和独立作者等内容所有者可能有权因其数据集被用于大规模AI模型训练而获得补偿。在高风险场景中回答此类数据使用问题,需要具体定义测试某些数据是否包含在模型训练数据集中意味着什么。虽然完全通用的训练数据归因问题询问模型在测试时的行为如何由特定训练实例引起,但当代合理使用讨论中实际的问题是仅关于成员身份的。成员推断攻击(MIA)询问某个特定样本是否在模型的训练数据集中;数据集推断攻击(DIA)将此推广到整个集合。作为与知识产权和生成式模型训练争议更相关的场景,本文研究DIA设置,但将两种问题类型统称为成员问题。

请参阅图注

图1:为了保护专有数据集免于在训练中被未经授权使用,数据集所有者(攻击者)使用秘密水印密钥改写其文档。为了执行数据集推断,攻击者测试可疑模型的预测是否有水印密钥的证据。水印检测测试用于判断其受保护数据是否被包含在训练数据集中。

是什么使得现代设置中的训练数据集成员测试变得困难?

对现代生成模型执行成员测试比在仅将输入映射到10或100个类别的判别性设置(即Shokri等人(2017)的设置)中更难。可变长度输出空间与输入基数匹配,使得分析复杂化,而现代模型数十亿参数的大小使得像影响函数这样的经典归因工具难以应用(Koh and Liang, 2017; Ilyas et al., 2022; Park et al., 2023)。即使在预训练规模下,“一个样本”的定义也是任意的(文档、句子、单词),且个体样本在共享n-gram方面高度重叠,这动摇了现有成员测试的稳定性(Duan et al., 2024)。现代生成模型还在语义和风格两条线上进行记忆和泛化,模糊了成员属性和生成属性之间的界限:样本成员身份通常既不是目标输出产生的必要条件也不是充分条件(Liu et al., 2025),且记忆率差异很大(Cooper et al., 2025)。

### 用于可靠数据集推断的主动干预。

我们的工作试图通过主动但谨慎地在训练数据集构建期间进行干预,以简化成员测试,从而规避上述部分困难。核心操作将是精确地标记模型的训练数据集,且不显著影响性能。这种干预将为标记者(数据所有者)提供重要的信息优势,使其了解训练数据集中被标记元素预计如何影响模型在测试时的预测,以及更重要的是,如何探测这些影响。我们将使用的主要技术工具是Kirchenbauer等人(2023)提出并研究的那种语言模型输出水印。这种水印解码算法将叠加在“改写器”语言模型之上,以创建具有相同风格和语义的候选样本版本,但能在水印检测测试下产生显著的p值。最近的研究表明,如果目标模型在水印样本上训练,它将吸收水印密钥的签名,并在测试时发出相同签名的影子(Sander et al., 2024)。然后,当攻击者使用水印检测测试探测可疑模型时,可以根据观察到的p值推断样本在该模型训练数据集中的成员身份。

#### 与先前工作的关系。

我们直接基于两项先前工作构建我们的研究。用作微调主干的折叠构造改编自Hayes等人(2025),我们将其配对数据MIA评估扩展到全子集成员(DIA)。主动水印DI方法建立在Sander等人(2024, 2025)的工作之上,他们展示了在水印样本上训练的目标模型可测量地再现了水印的密钥特定签名。我们采用其敏感的“阅读模式”检测器,该检测器在条件于水印前缀上测试下一个令牌预测(argmax),而不是完全展开的完成。我们在标记子集上变化每个密钥支持分数和有效周期,将检测测试的参数尾部替换为经验零假设随机化测试(第2.2节),并针对基于损失和参考模型的基线——原始损失(Yeom et al., 2018)、argmax匹配、min-k%(Shi et al., 2024)、zlib(Carlini et al., 2021)、以及rMIA-simple、rMIA和LiRA(Carlini et al., 2022)——在相同的配对试验上进行基准测试(附录C.6节)。

我们的目标是统一这些设置和方法,以校准关于基于水印的数据集成员测试是否准备好用于实践的论断。

贡献:

*   我们形式化了基于水印的主动数据集推断的通用威胁模型,作为以数据所有者为中心的安全博弈,并将先前工作置于研究此问题的一个特定实例的背景中(第2节)。
*   我们提出了一种基于随机化的水印检测测试变体,确保在预训练检查点、干预样本和特定水印密钥之间的交互下p值的有效性(第2.2节)。
*   我们实现了一个统一的实验设置,用于在相同的配对试验上评估传统的基于损失的数据集推断分数和基于水印的方法,并在各自威胁模型假设下比较每种技术的性能(第3.1节)。
*   我们消融了先前研究中探索不足的维度:在固定训练预算下每个密钥支持与重复、从头训练与继续预训练、以及标记子集的插入时间表形状(第3.1和3.2节)。

## 2 方法

###### 定义2.1(威胁模型:面向数据所有者的主动数据集推断)。Alice怀疑模型所有者Bob将在 \( D_{tr} := D_A \cup D_{web} \) 上训练语言模型 \( f_{tgt} \),其中 \( D_A \) 是Alice拥有或控制的部分,其余部分来自Alice不控制的来源。Alice想要一个得分 \( d: f_{tgt}, \mathcal{D}_A \to (0,1) \),该得分预测Bob是否将任何 \( D_A \) 包含在 \( D_{tr} \) 中。允许Alice在Bob访问 \( D_A \) 之前,使用标记变换 \( T_m: \mathcal{X} \to \mathcal{X}_m \) 修改 \( D_A \)。攻击成功与否根据表示 \( D_A \) 是否包含在 \( D_{tr} \) 中的真实成员标签 \( m \in \{0,1\} \) 来评估。在最严格的设置中,Alice既没有计算资源为 \( f_{tgt} \) 训练影子模型,也没有隐藏的类似数据 \( D'_A \) 的影子副本来校准检测器。

###### 定义2.2(小工具:基于水印的数据集保护)。Alice使用在生成模型 \( f_{wm}: \mathcal{X}, k \to \mathcal{X}_{wm} \) 上运行由秘密密钥 \( k \) 键控的输出水印方案来实例化 \( T_m \),其检测器 \( d(f_{tgt}, k, D_A) \) 接受一个检验统计量 \( z \in \mathbb{R} \) 和关联的 \( p \)-值。她通过 \( f_{wm} \) 标记 \( D_A \) 的全部或部分,基于以下假设:Bob的 \( f_{tgt} \) 在样本 \( x \in \mathcal{X}_{wm} \) 上训练后,将产生新的生成,在 \( k \) 下产生显著的检测分数。一个在 \( z \) 上的决策函数 \( g: \mathbb{R} \to (0,1) \) 随后实现了成员得分 \( d = g(z) \),其中 \( p \)-值本身是显而易见的选择。零假设定义为 \( \mathcal{H}_0 \):Bob的模型 \( f_{tgt} \) 的训练使得 \( D_A \cap D_{tr} = \emptyset \),或者更精确地说,\( D_{tr} \) 中没有任何样本用 \( k \) 标记。假设选择了典型的 \( g(\cdot) \),如果观察到低于 \( \alpha \) 的 \( p \)-值,Alice拒绝零假设并得出结论:Bob很可能在她的数据集上训练了 \( f_{tgt} \)。

### 2.1 目标模型假设

我们假设目标模型的分词器是已知的,并且与改写器的分词器匹配。先前工作已经表明这个假设可以放宽,并且水印可检测性仍然可以通过公共令牌过滤保持(Sander et al., 2024, 2025; Xu et al., 2026),因此我们在此维度上省略实验。我们还假设攻击者可以查询目标模型以获得条件于前缀的下一个令牌预测概率——即Sander等人(2024)的“阅读模式”检测过程。如果每次调用生产API进行每个令牌,这在实践中是一个成本高昂的假设。然而,在我们考虑的支持分数下,数据强迫的阅读模式测试所需的更高灵敏度是必要的:对于仅温和暴露于水印签名的目标模型,天真地展开完成不能产生足够低的p值以实现可靠检测。允许攻击者放松阅读模式假设的检测改进是未来工作的一个明显方向,但不在本文讨论范围之内。

### 2.2 确保P值有效性

先前关于基于水印的DIA的工作报告了干预下的显著p值,否则接近零值(Sander et al., 2025)。然而,我们的初步复现实验表明,即使经过仔细的去重,特别是在使用阅读模式检测器时,模型检查点、干预数据集中的特定样本以及所使用的特定水印密钥之间的交互可能会使标准参数尾部界限所依赖的独立性假设失效。因此,我们提出一个标准的基于随机化(排列)的假设检验变体,该变体基于可交换性假设建立经验零假设,从而生成有效的p值。此方法允许我们配置精确p值的分辨率,并且仅给攻击者的测试协议增加少量计算开销。

###### 定义2.3(用于精确p值的水印密钥随机化测试)。假设Alice的水印秘密 \( k_i \) 从适用于水印方案使用的PRF的密钥分布中独立同分布采样,\( k_i \sim \mathcal{K} \)。在零假设下,\( f_{tgt} \) 没有在标记了 \( k_i \) 或任何其他 \( k_j \in \mathcal{K} \) 的数据上训练¹。因此,对于检测器 \( d(f_{tgt}, k, D_A) \) 产生的检验统计量,所有密钥 \( k_j \neq k_i \) 相对于该统计量是可交换的。为了使用随机化测试计算精确p值,Alice采样 \( M-1 \) 个不同的额外密钥,然后产生 \( z_j = d(f_{tgt}, k_j, D_A), \forall j \in M \),包括她的密钥 \( k_i \)。这 \( M \) 个得分按降序排序以确定每个密钥的最终排名 \( r_j \)(最高的 \( z \) 产生最小的 \( r \))。测试的精确p值为 \( r_i / M \),即Alice的实际密钥在 \( M \) 个中的排名。在零假设下,由于可交换性,观察到她的密钥处于排名 \( r_i \) 或更早的概率正好是 \( P[r \leq r_i | \mathcal{H}_0] = r_i / M \),这使得这在没有额外假设的情况下成为有效的p值。测试时成本通过使用textseal(Sander et al., 2025; Fernandez et al., 2025)中的向量化PRF实现来控制,对于任何给定文本并行评估多个水印秘密。我们通过使用KS检验确认p值的均匀性,在实践上验证了所得经验零假设的有效性(见图4、14和22)。对于低于 \( 1/M \) 经验样本分辨率的p值,我们在有用时报告对同一零假设分布的外推经验高斯拟合。

请参阅图注 请参阅图注

图2:在对齐的展开检测表面上,微调事件分割匹配的干净孪生假探测零(左)和键控信号(右),在经验精确参考下以 \( -\log_{10} p \) 得分。

## 3 实验

我们的实验围绕一个受控的数据折叠设计构建,该设计允许我们模仿先前关于语言模型中成员和数据集推断的研究,同时基准测试主动水印方法。在较小的微调制度下,我们通过调节训练期间的子集大小和重复次数来系统地改变模型暴露于干预数据的水平,然后转向更大的100亿令牌训练制度,在其中我们消融标记子集的插入时间表以及初始化选择(继续预训练与从头开始)。

#### 设置。

在我们的实验中,我们追求深度而非广度。因此,我们在所有实验中使用单个语言模型 Qwen3/Qwen3-1.7B(Yang et al., 2025),要么作为预训练权重集,要么作为从头实验的架构规范。类似地,我们采用一个包含 \( N=1500 \) 个自然外观b......(原文截断,此处按原文输出)

相似文章

针对封闭 LLM 的可证明检测的数据集水印

arXiv cs.LG

本文提出了一种针对封闭大型语言模型(LLM)的新型数据集水印方法。该方法利用词对共现模式,能够以可证明的方式检测模型训练是否使用了专有数据,即使这些数据在训练数据集中仅占极小比例。

AI生成内容中的水印

Reddit r/artificial

关于强制在AI生成内容中添加水印以防止诈骗的讨论,提及谷歌在图片中嵌入的隐形水印。

通过追踪重写保护语言模型免受未授权蒸馏

arXiv cs.CL

本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。