线性集成消除水印:论LLM中分布扰动的脆弱性
摘要
本文揭示了LLM水印的一个基本漏洞:当用户能够访问多个模型时,对其输出分布进行平均会抵消水印扰动,从而规避检测。作者提出了WASH方法,并通过实验证明,对3-5个模型进行平均可将检测z分数抑制在阈值以下,同时提升文本质量。
arXiv:2605.30501v1 公告类型:新
摘要:水印技术通过在AI生成的文本中嵌入统计特征来实现检测与归属。我们揭示了一个基本漏洞:当用户能够访问多个模型时(这是当今的现实情况),水印会轻易失效。水印会使输出分布偏离原始分布,而在竞争市场中,这些扰动在不同提供商之间通常是独立的。我们从理论上证明,对输出概率分布进行平均可以恢复无水印的分布,误差项仅为二阶。实验表明,仅对3-5个模型进行平均即可消除这些扰动。我们提出了WASH(通过统计混合衰减水印)方法,它解决了集成生成中的实际挑战:异构模型之间的词汇对齐和分词差异。在六种水印方案和三个LLM上的实验表明,对3个模型进行平均可将检测z分数从5-300抑制到2以下(低于检测阈值4),并将5% FPR下的TPR降低至50%以下,同时将文本质量提升27.5%,且在长序列生成上的运行速度比最佳基线快6倍。我们的结果表明,通过水印实现鲁棒的AI文本检测要么需要接受这一基本漏洞,要么需要模型提供商之间前所未有的协调。
查看缓存全文
缓存时间: 2026/06/01 09:24
# 线性集成冲走水印:论LLM中分布扰动的脆弱性 来源: https://arxiv.org/html/2605.30501 ###### 摘要 水印通过在AI生成的文本中嵌入统计特征来实现检测与溯源。我们揭示了一个根本性漏洞:当用户能够访问多个模型(这在当今是现实情况)时,水印很容易失效。水印会使输出分布偏离原始分布,而在竞争激烈的市场中,不同提供商的这些扰动通常是相互独立的。我们理论上证明,对输出概率分布进行平均可以恢复未加水印的分布,误差仅为二阶项。实验表明,仅对3-5个模型进行简单平均就能抵消这些扰动。我们提出了WASH(通过统计混合实现水印衰减),它解决了集成生成中的实际挑战:异构模型间的词汇不匹配和分词差异。在六种水印方案和三种LLM上的实验表明,对3个模型进行平均可将检测z分数从5-300降至2以下(低于4的检测阈值),并将TPR@5%FPR降至50%以下,同时将质量提升27.5%,在长序列生成上运行速度比最佳基线快6倍。我们的结果表明,通过水印实现稳健的AI文本检测,要么接受这一根本性漏洞,要么需要模型提供商之间进行前所未有的协调。 机器学习,ICML ## 1 引言 大型语言模型(LLM)在从教育评估到内容创作等关键应用中的快速部署,使得可靠的溯源机制成为迫切需求(Wang等人,2024 (https://arxiv.org/html/2605.30501#bib.bib27);Khasentino等人,2025 (https://arxiv.org/html/2605.30501#bib.bib31);Wang等人,2026 (https://arxiv.org/html/2605.30501#bib.bib32))。我们能否确定一段给定文本是否由AI系统生成?在合成文本与人类写作日益难以区分的时代,这些问题对学术诚信、内容真实性和知识产权保护具有深远影响(Wei等人,2023 (https://arxiv.org/html/2605.30501#bib.bib29);Yao等人,2024 (https://arxiv.org/html/2605.30501#bib.bib30))。水印已成为解决这一溯源问题的技术方案(Kirchenbauer等人,2023a (https://arxiv.org/html/2605.30501#bib.bib2);Liu等人,2024 (https://arxiv.org/html/2605.30501#bib.bib28))。通过在文本生成过程中嵌入统计特征,无偏水印有望使AI生成内容可检测,同时最小化质量下降并避免架构变更(Hu等人,2024 (https://arxiv.org/html/2605.30501#bib.bib3);Mao等人,2024 (https://arxiv.org/html/2605.30501#bib.bib4))。然而,当前的水印研究基于一个关键的简化假设:攻击者只能访问单个带水印的模型。实际上,如今用户可以通过统一平台(如Hugging Face)轻松免费访问10多个前沿LLM,包括GPT、LLaMA、Qwen、Mistral以及其他数十个能力强大的模型。现代LLM格局并非垄断,而是一个拥有多个提供商的激烈竞争市场,而这种竞争结构正是水印的致命弱点。 参见图注 图1:线性集成的效果。集成平均\\( \bar{p}_{N} \\)(右)抵消了独立的水印扰动\\( p_{i} \\)(中),有效恢复了原始共识分布\\( p^{*} \\)(左),这是通过平均未加水印模型计算得到的。 我们的核心见解简单得令人难以置信:水印通过扰动模型的输出分布来工作,而这些扰动由于不同的密钥和架构设计在不同提供商之间是独立的。通过并行查询多个模型并对其输出分布进行平均,这些独立的扰动会相互抵消,从而恢复原始的未加水印分布(如图1所示)。我们对此进行了形式化证明:对于任何具有独立单模型扰动的无偏水印方案,线性集成可以恢复共识分布,误差为二阶项,收敛速度为\\( O(1/\sqrt{N}) \\)。这建立了一个植根于市场结构的根本限制:竞争性提供商必须使用密钥进行来源验证(保证独立性),并维持质量以留住用户(限制扰动幅度)。在这些约束下,水印信号在数学上必然会在平均化操作下消失。 虽然理论结果保证了渐近消除,但实际部署面临着效率和连贯性方面的关键障碍。试图通过“随机选择探测”来逼近水印参数的框架(Chen等人,2025a (https://arxiv.org/html/2605.30501#bib.bib12))需要大量迭代查询,导致推理延迟过高。同时,通过拼接来自异构模型的Token进行攻击的方法,需要在每个时间步预测额外Token,并在每次切换时重新编码整个上下文(Huang等人,2024 (https://arxiv.org/html/2605.30501#bib.bib8)),导致计算效率低下。为弥合这些差距,我们提出了WASH(通过统计混合实现水印衰减)。WASH采用流畅度感知路由来克服词汇不匹配,从而在异构分词器之间实现有效的概率聚合。此外,通过利用并行推理与响应缓存,WASH消除了迭代探测或上下文重新编码的需求,实现了**与集成规模\\( N \\)无关的每个Token恒定时间复杂度**。大量实验表明,WASH将生成质量提升了\\( 27.5\% \\),同时运行速度比最先进的去除基线快\\( 6 \\)倍。我们的分析揭示,水印面临一个根本性选择:要真正稳健地区分AI文本与人类文本(无论模型如何混合),就需要**协调式水印**,即所有模型共享某种公共信号。 本文通过以下贡献严格刻画了这一根本性限制: 1. **理论证明**:我们理论上证明线性集成能够渐近恢复原始的未加水印分布。我们展示了在\\( N \\)个独立模型下收敛速度为\\( O(1/\sqrt{N}) \),揭示了多提供商环境下无偏水印的根本限制。 2. **提出WASH**:我们提出了WASH,一种新颖的算法,用于克服异构模型集成中的词汇不匹配问题。通过采用流畅度感知路由和上下文重新同步,WASH在消除水印信号的同时保持了语义完整性。 3. **系统评估**:我们在两种互补的检测设置下,对六种代表性水印方案和三种LLM进行了系统评估。实验表明检测几乎完全失效:(a) 对于生成时刻检测,仅用3个模型,WASH就将z分数从5-300(强烈可检测)降至<2(接近随机选择);(b) 对于最终文本检测,WASH将原生序列检测器上的TPR@5%FPR降至50%以下,使水印在统计上不可检测。 ## 2 方法论 当多个独立带水印模型的输出被聚合时,水印展现出一个结构性的统计漏洞。形式上,我们将水印概念化为应用于共享底层分布\\( p^{*} \\)的随机扰动。虽然这些扰动对于检测是必要的,但它们在不同提供商之间充当了不协调的噪声。因此,当来自多个模型的输出被组合时,水印信号会相消干涉,使得底层共识分布能够被渐近恢复。我们现在通过刻画共识分布、受扰动的带水印分布以及它们聚合之间的关系,来形式化这一观点。 令\\( \mathcal{V} \\)为词汇表,\\( \mathcal{X} \\)为可能上下文(即Token序列)的空间。我们将词汇表上的概率分布表示为\\( \Delta(\mathcal{V}) = \left\{ \mathbf{p} \in \mathbb{R}^{|\mathcal{V}|} \;\middle|\; p_v \geq 0, \sum_{v \in \mathcal{V}} p_v = 1 \right\} \)。 ### 2.1 问题形式化 概念上,任何模型\\( i \\)的概率分布都会由于共享的系统误差和特定提供商的差异而偏离理想的语义分布\\( p_{GT} \\)(与人类专家一致)。我们将其建模为: \\( p_i(v|x) \propto p_{GT}(v|x) \cdot \exp\left( \underbrace{\delta_{sys}(v,x)}_{\text{共享模型偏差}} + \underbrace{\delta_i(v,x)}_{\text{水印}} \right) \\)。 这里,\\( \delta_{sys} \\)代表当前LLM架构固有的共同偏差,而\\( \delta_i \\)则封装了特定提供商的信号,主要是水印信号,但也包括模型自身的特性。 ###### 定义2.1(共识分布与带水印扰动) 我们将共识分布\\( p^{*}(\cdot|x) \in \Delta(\mathcal{V}) \\)定义为当前模型的有效基线,吸收了共享的系统偏差: \\( p^{*}(v|x) \propto p_{GT}(v|x) \cdot \exp(\delta_{sys}(v,x)) \\)。 因此,特定带水印模型\\( i \\)的输出分布定义了一个扰动分布\\( p_i(\cdot|x) \\): \\( p_i(v|x) = \frac{p^{*}(v|x) \cdot \exp(\delta_i(v,x))}{Z_i(x)} \\), (1) 其中\\( \delta_i: \mathcal{V} \times \mathcal{X} \to \mathbb{R} \\)是特定提供商的扰动函数(水印信号),\\( Z_i(x) \\)是归一化项。 能够去除水印的关键洞察是:不同独立提供商的扰动在统计上是无偏的。我们形式化这一假设如下。 ###### 假设2.2(无偏扰动) 考虑一组由\\( i \\)索引的离散提供商,每个提供商关联一个随机扰动向量\\( \delta_i(\cdot, x) \\),该向量调制输出分布。我们假设\\( \{\delta_i\}_{i=1}^N \\)满足以下性质: (a) **有界幅度**:扰动幅度被常数\\( \xi \leq 1 \\)一致有界。具体地,对于所有\\( x \in \mathcal{X} \\)和提供商\\( i \\),有\\( \|\delta_i(\cdot, x)\|_{\infty} \leq \xi \\)。 (b) **独立性**:扰动向量\\( \delta_i \\)在不同提供商之间独立。 (c) **零均值**:水印信号在对数空间中以共识分布为中心,使得对所有\\( v \in \mathcal{V}, x \in \mathcal{X} \\)和提供商\\( i \\),有\\( \mathbb{E}[\delta_i(v,x)] = 0 \\)。 (d) **有界期望方差**:扰动在词汇表上的加权变异(以共识概率加权)的期望被常数\\( \eta^2 \\)界定。即,对所有\\( x \in \mathcal{X} \\): \\( \mathbb{E}\bigl[ \mathrm{Var}_{u \sim p^{*}}(\delta_i(u,x)) \bigr] \leq \eta^2 \\), (2) 其中 \\( \mathrm{Var}_{u \sim p^{*}}(\delta_i(u,x)) := \sum_u p^{*}(u) \bigl( \delta_i(u) - \sum_v p^{*}(v) \delta_i(v) \bigr)^2 \\)。 (3) 这一假设在多提供商环境下是自然的:(a) 市场力量对扰动幅度施加了严格的上界\\( \xi \\),因为任何足以违反线性近似(大的\\( \delta \\))的水印都会导致可感知的质量下降。(b) 每个提供商使用彼此未知的水印配置,使得扰动表现为独立的随机变量。这可以放宽到分组设置,其中提供商共享共同潜在因子:在组间独立性和组内条件独立性下,同样的收敛保证成立;参见附录B (https://arxiv.org/html/2605.30501#A2)。(c) 提供商独立优化质量,没有理由系统性地偏向或排斥特定Token,超出\\( p^{*} \\)所暗示的范围。我们还在附录C (https://arxiv.org/html/2605.30501#A3) 中故意使用有偏的水印扰动对零均值假设进行了压力测试。(d) 最后,提供商通过优先考虑高概率Token的稳定性来最大化效用;\\( p^{*} \\)加权确保显著方差仅限于稀有Token,从而对整体文本质量影响最小。 ### 2.2 通过线性集成去除水印 给定\\( N \\)个独立模型,我们提出通过均匀混合来中和水印信号并恢复共识分布,我们将这种方法称为WASH。由于扰动\\( \delta_i \\)在不同提供商之间不相关,它们充当了可以通过平均消除的噪声。对于固定上下文\\( x \in \mathcal{X} \\),聚合概率分布定义为 \\( \bar{p}_N(\cdot|x) := \frac{1}{N} \sum_{i=1}^N p_i(\cdot|x) \\)。 (4) 我们将这一去除过程实现为自回归集成。生成过程可以形式化为递归序列。令\\( \delta > 0 \\),以至少\\( 1 - \delta \\)的概率,聚合分布与共识分布\\( p^{*}(\cdot|x) \\)之间的\\( \ell_{\infty} \\)距离满足: \\( \bigl\| \bar{p}_N(\cdot|x) - p^{*}(\cdot|x) \bigr\|_{\infty} \lesssim \sqrt{ \frac{\log(|\mathcal{V}|/\delta)}{N} } + \eta^2 \\), (5) 其中\\( |\mathcal{V}| \\)表示词汇表大小,\\( \eta^2 \\)是如(2)中定义的扰动期望加权方差的上界。 参见图注 图2:WASH框架概览。该方法集成\\( N \\)个独立模型,通过概率平均中和水印。为解决词汇不匹配,**流畅度感知路由**在Token落在共享词汇交集\\( \mathcal{V}_{\cap} \\)之外时,提交给专家模型\\( K^{*} \\),并采用**重新分词**来同步上下文,确保异构分词器之间的语义对齐。 ###### 证明梗概 证明依赖于将近似误差分解为**随机偏离项**和**系统偏差项**。由三角不等式,聚合分布\\( \bar{p}_N \\)与共识分布\\( p^{*} \\)之间的距离可以界为: \\( \| \bar{p}_N - p^{*} \|_{\infty} \leq \underbrace{\| \bar{p}_N - \mathbb{E}[\bar{p}_N] \|_{\infty}}_{\text{随机偏离}} + \underbrace{\| \mathbb{E}[\bar{p}_N] - p^{*} \|_{\infty}}_{\text{系统偏差}} \\)。 **界定随机偏离**。由于提供商是独立的(假设2.2(b)),聚合概率\\( \bar{p}_N(v) \\)是独立有界随机变量的平均值。直接应用Hoeffding不等式表明\\( \bar{p}_N \\)集中在其期望附近。相似文章
针对封闭 LLM 的可证明检测的数据集水印
本文提出了一种针对封闭大型语言模型(LLM)的新型数据集水印方法。该方法利用词对共现模式,能够以可证明的方式检测模型训练是否使用了专有数据,即使这些数据在训练数据集中仅占极小比例。
语言感知的非失真性LLM水印
介绍了LUNA,一种语言感知的LLM水印方法,实现了跨多语言的非失真嵌入和无模型检测,显著提升了AUROC和困惑度保持。
LLM群体智慧:语言模型集成中的聚合与污染
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
基于双重语义嵌入的大语言模型鲁棒文本水印
本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。
AI水印证据未能通过取证准备:一项实证评估
本文实证评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)在取证可采性标准下的表现,发现没有一种方法达到法院要求的证据标准:在保留语义的改写后,水印几乎100%被移除,甚至在攻击前假阴性率就很高。