AI水印证据未能通过取证准备:一项实证评估

arXiv cs.CL 论文

摘要

本文实证评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)在取证可采性标准下的表现,发现没有一种方法达到法院要求的证据标准:在保留语义的改写后,水印几乎100%被移除,甚至在攻击前假阴性率就很高。

arXiv:2607.16010v1 Announce Type: cross 摘要:各国政府越来越多地要求LLM生成的内容带有水印。欧盟AI法案要求标记“足够可靠和稳健”。加利福尼亚州的SB 942要求披露“永久性或极难移除”。这两项规定均基于一个未经验证的假设:水印检测能提供足够可靠的证据以供法庭使用。本文直接检验了这一假设。 我们评估了三种代表性的LLM水印方法——KGW、Unigram以及MarkLLM实现的SynthID-Text——对照Daubert可采性标准和NIST SP 800-86数字取证流程。为了结构化这一评估,我们提出了一个包含12项标准、3道强制关卡和60分评分系统的取证准备评分(FRS)框架。我们重点关注保留语义的改写作为攻击向量,因为它在法律上现实且难以被认定为证据篡改。 结果引发了严重的证据问题。在每种方法15个不同提示的846次有效改写运行中,每一个初始检测到的KGW和Unigram文本在改写后都失去了水印——条件移除率100%。SynthID表现稍好,为98.3%。即使在攻击前,假阴性率已经很高:KGW为70%,Unigram为83%,SynthID为80%。SynthID配置还将5.4%改写后的人类撰写控制文本标记为AI生成,并显示出18.6%的悖论率,其自身80%的纯净水印输出落在不确定性死区。三种方法均未能满足Daubert五个因素中的两个以上。我们还发现,尽管FRS基于点的评分系统按设计工作,但无法完全捕捉取证的无效性——这一局限性值得在未来的框架设计中注意。 这些经过测试的配置未能达到法院要求的证据标准。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:37

# AI水印证据未达到取证就绪标准:一项实证评估
来源:https://arxiv.org/html/2607.16010

###### 摘要

各国政府越来越多地要求带有水印的LLM生成内容。欧盟《人工智能法案》要求标记必须“充分可靠且稳健”。加利福尼亚州的SB 942法案则要求披露信息“永久性或极难移除”。这两项法规都基于一个未经检验的假设:水印检测产生的证据在法庭上足够可靠。本文直接检验了这一假设。

我们评估了三种具有代表性的LLM水印方法——KGW、Unigram以及MarkLLM实现的SynthID-Text——对照Daubert可采性标准和NIST SP 800-86数字取证流程。为了构建这一评估,我们提出了一个包含12项标准、三个强制性关卡和60分评分系统的取证就绪评分(FRS)框架。我们将重点放在保留语义的释义这一攻击向量上,因为它既在法律上现实,又难以被轻易视为证据篡改。

结果引发了严重的证据问题。在每种方法的15个多样化提示词下进行的846次有效释义运行中,初始可检测到的KGW和Unigram文本在释义后全部丢失了水印——100%的条件性移除。SynthID的表现也仅稍好,为98.3%。即使在没有任何攻击的情况下,假阴性率已经很高:KGW为70%,Unigram为83%,SynthID为80%。SynthID配置还将5.4%的释义后人类撰写的对照组标记为AI生成,并显示出18.6%的矛盾率,其自身80%的原始带水印输出落入了不确定死区。这三种方法均未能满足超过两个Daubert因素。我们还发现,基于分数的FRS评分系统尽管按设计正常工作,但无法完全捕捉取证无用性——这是未来框架设计中值得注意的一个局限性。

这些经过测试的配置,未能达到法院要求的证据标准。

预印本。本文的一个版本已提交至2026年AAAI/ACM人工智能、伦理与社会会议(AIES)。

## 引言

设想一个法庭场景。检察官提供一份文本,声称其为AI生成,并引用了正面的水印检测结果。辩护律师拿到同一份文本,通过一个任何人都可以在线访问的释义工具进行处理,交回一个意思相同、但不再触发水印检测器的版本。检方的证据就这样蒸发了。意义得以保留。法官该如何处理这种情况?

这并非一个牵强的假设。欧盟《人工智能法案》要求AI生成的内容标记“在技术可行的情况下,应足够可靠、可互操作、有效且稳健”(European Parliament and Council of the European Union2024 (https://arxiv.org/html/2607.16010#bib.bib19))。加利福尼亚州的SB 942法案坚持披露信息必须“永久性或极难移除”(California State Legislature2024 (https://arxiv.org/html/2607.16010#bib.bib20))。第14110号行政命令更进一步,强制要求使用“最先进”的来源追踪工具,并明确提到了水印技术(The White House2023 (https://arxiv.org/html/2607.16010#bib.bib21))——尽管该命令后来被撤销(The White House2025 (https://arxiv.org/html/2607.16010#bib.bib22)),这本身也说明了政策基础变化之快。

这些法规的共同点在于一个假设:底层的水印技术实际上足够可靠,能够产生达到法庭标准的证据。但这个假设从未直接对照取证可采性标准进行评估。鲁棒性研究衡量检测器在面对攻击时的表现,使用的是TPR和AUC等机器学习指标。治理分析则探讨水印技术周围的政策基础设施是否充分。这两种传统方法都没有提供法庭实际需要的东西:一个端到端的评估,判断水印证据是否满足Daubert可采性标准,并遵循NIST SP 800-86取证流程(Lianget al.2025 (https://arxiv.org/html/2607.16010#bib.bib4); Nemeceket al.2025 (https://arxiv.org/html/2607.16010#bib.bib5))。

在此提供一些背景知识很有帮助。Daubert标准(Daubert1993 (https://arxiv.org/html/2607.16010#bib.bib12))是美国联邦法院决定科学证据是否可采的方式——它们关注可检验性、同行评审、已知错误率、标准的存在以及普遍接受度。NIST SP 800-86(National Institute of Standards and Technology2006 (https://arxiv.org/html/2607.16010#bib.bib15))阐述了数字取证证据应如何收集、检查、分析和报告。近期的研究警告称,如果没有真正的可执行标准,水印技术有可能沦为“象征性合规”(Nemeceket al.2025 (https://arxiv.org/html/2607.16010#bib.bib5))。我们想看看实证数据是否支持这种担忧。答案是肯定的。

本文贡献了四点:

1. 1. 对代表性LLM水印技术进行实证评估,对照取证可采性标准(包括NIST SP 800-86和Daubert)。
2. 2. 一个取证就绪评分(FRS)框架:12个可评分标准,基于Daubert因素和NIST阶段,外加3个强制性关卡和一个60分制量表。
3. 3. 针对KGW、Unigram和SynthID-Text的释义实验,通过时间戳和相同种子的计算重运行验证可重复性。
4. 4. 证据表明,保留语义的释义实现了两种方法100%的条件性水印移除(第三种为98.3%),同时保持了足够高的语义相似性,以至于法院很难将其定性为证据篡改。

随着带有水印的AI系统被广泛部署,法院将会遇到这类证据,但却没有任何既定的评估框架。我们提供了这个框架——并表明,至少对于这些配置而言,证据是站不住脚的。

## 背景与相关工作

### LLM水印方法

我们测试了三种代表不同设计理念的水印方法,均可通过开源MarkLLM工具包获取(Panet al.2024 (https://arxiv.org/html/2607.16010#bib.bib6))。

KGW(Kirchenbaueret al.2023 (https://arxiv.org/html/2607.16010#bib.bib1))通过使用前一个token的哈希值将词汇表分割成“绿色”和“红色”列表。在文本生成过程中,绿色列表中的token会获得由参数δ\\delta控制的logit提升,推动模型偏向这些token。检测时,则通过z分数检查输出中绿色token的比例是否异常高。这种设计的一个重要结果是:由于分割依赖于每个token的前驱,改变一个token可能会波及后续所有的分割。

Unigram(Zhaoet al.2024 (https://arxiv.org/html/2607.16010#bib.bib2))采用了一种不同的方法——它使用固定的、与上下文无关的词汇表分割。无论之前的token是什么,绿色/红色分割保持不变,这理论上使其对局部编辑更具弹性。检测仍然使用基于绿色token频率的z分数,但固定的分割意味着该方法应该更能抵抗有界编辑距离攻击。

SynthID-Text(Dathathriet al.2024 (https://arxiv.org/html/2607.16010#bib.bib3))是我们评估中最引人注目的方法——发表在《自然》杂志上,由Google在生产环境中部署。它使用基于锦标赛的评分和概率检测。我们评估的是开源的MarkLLM实现,而非Google的专有系统(我们将在局限性中再次强调这一重要区别)。与其他两种方法不同,SynthID使用三种检测状态——WATERMARKED(有水印)、NOT_WATERMARKED(无水印)和UNCERTAIN(不确定)——而不是简单的二元阈值。在我们的实验中,我们使用MarkLLM的加权平均检测器,阈值为0.5,不确定死区为±0.03\\pm 0.03。

这三种方法一起涵盖了主要的设计空间:上下文相关分割(KGW)、上下文无关分割(Unigram)和基于锦标赛的概率评分(SynthID)。这个范围很重要,因为我们想测试取证失败是通用方法的属性,还是仅仅是某种特定设计的问题。

### 取证证据标准

有两个框架与法院处理科学和数字证据的方式相关。

**Daubert标准。** 根据*Daubert v. Merrell Dow Pharmaceuticals*(Daubert1993 (https://arxiv.org/html/2607.16010#bib.bib12))和《联邦证据规则》702条(Federal Rules2023 (https://arxiv.org/html/2607.16010#bib.bib13)),法官根据五个因素评估科学证据:(1) 可检验性和可证伪性,(2) 同行评审和发表,(3) 已知或潜在的错误率,(4) 控制标准的存在,以及 (5) 普遍接受度。对于水印技术,因素3——已知错误率——被证明是关键弱点。如果错误率不稳定或未知,证据就很难被采纳。我们注意到,Daubert是美国联邦证据标准;遵循*Frye*标准的州法院以及民法法系(例如,欧盟程序规则下)使用不同的可采性测试。我们使用Daubert作为主要视角,因为它与NIST关于错误率的措辞在概念上高度契合,但我们所记录的取证弱点——不稳定的错误率、缺乏控制标准——与任何对科学证据提出类似问题的可采性框架都是相关的。

**NIST SP 800-86。** NIST的数字取证指南(National Institute of Standards and Technology2006 (https://arxiv.org/html/2607.16010#bib.bib15))定义了四个阶段:收集、检查、分析和报告。据我们所知,目前的水印评估都没有记录与这些阶段一致的端到端工作流程。这很重要,因为仅水印检测本身并不是一个取证过程;只有当它嵌入到有记录的收集、检查、分析和报告工作流程中时,它才成为法医证据。NIST已单独承认了数字内容透明度的更广泛挑战(National Institute of Standards and Technology2024 (https://arxiv.org/html/2607.16010#bib.bib16)),但目前没有现成的指南将水印检测与取证证据处理衔接起来。

**历史先例。** 这里有一个值得注意的模式。2009年的NAS报告(National Research Council2009 (https://arxiv.org/html/2607.16010#bib.bib17))发现,一些法医学学科——指纹分析、咬痕比对、毛发显微镜检查——在没有充分科学验证的情况下在法庭上被使用了数十年。2016年的PCAST报告(President’s Council of Advisors on Science and Technology2016 (https://arxiv.org/html/2607.16010#bib.bib18))也提出了类似的观点。后果是真实的:错误定罪。AI水印技术似乎正走在同一条道路上——在实践中部署,写入法规,但实际上并未对照法院用于判断证据是否足够可靠以被采纳的标准进行验证。

### 相关工作

**水印鲁棒性评估。** 迄今为止最全面的鲁棒性研究是Liang等人(2025 (https://arxiv.org/html/2607.16010#bib.bib4))的WaterPark,它测试了10种水印方法,针对12种攻击类型,跨越三个语言模型(OPT-1.3B, LLaMA3-7B, Qwen2.5-14B)和五个数据集。他们的发现与我们的直接相关:SynthID的真阳性率从干净文本上的0.998下降到中等释义下的0.498。单次ChatGPT释义就使*每种*测试方法都低于30%的检测率。他们还发现了巨大的跨模型变异性——在相同的攻击条件下,KGW的TPR从OPT上的0.858下降到LLaMA3上的0.334。但是WaterPark完全通过机器学习指标进行评估。它没有询问这些数字是否能满足Daubert听证会的要求,也没有将结果映射到NIST取证阶段。其他工作已经建立了强水印的理论不可行性结果(Zhanget al.2024 (https://arxiv.org/html/2607.16010#bib.bib8)),表明在对抗性环境下可靠的AI文本检测可能是不可能的(Sadasivanet al.2023 (https://arxiv.org/html/2607.16010#bib.bib9)),并展示了利用水印设计属性的攻击(Panget al.2024 (https://arxiv.org/html/2607.16010#bib.bib7))。这些都指向了脆弱性,但没有一个涉及可采性。值得注意的是,WaterPark发现一轮ChatGPT释义就会使所有方法降至30% TPR以下,这表明我们使用的同模型释义器实际上代表了情况可能变得更糟的*保守*下限。

**基于蒸馏的攻击与归属模糊性。** Pan等人(2025 (https://arxiv.org/html/2607.16010#bib.bib10))证明,在未经授权的知识蒸馏过程中,水印痕迹可以被剥离。Yi等人(2025 (https://arxiv.org/html/2607.16010#bib.bib11))将其扩展到针对KGW、Unigram和SynthID-Text的统一伪造和擦除攻击。其取证意义超越了鲁棒性:即使*确实*检测到了水印,这个信号可能并不意味着你认为的意思。它可能反映直接生成、从蒸馏中继承的痕迹,或者蓄意的伪造。这种归属模糊性使得在法庭上建立稳定的错误率解释变得非常困难。

**治理与政策。** Nemecek等人(2025 (https://arxiv.org/html/2607.16010#bib.bib5))认为,没有可执行标准的水印技术相当于“象征性合规”,并提出了一个涵盖技术要求、审计基础设施和执法的三层治理框架。他们的论文包含了一个原型评估记分卡,采用0-5分制——这种设计最终与我们的FRS趋同。他们还独立地在Gemma-2-9b-it上运行了SynthID,发现释义消除了5个案例中的4个检测。但他们的贡献本质上是治理论证,而非系统的实证测试:五个提示词,没有取证流程,没有FRS式评分。

表1:本文如何与先前的水印评估相比较。我们在攻击方面更窄,但在取证可采性方面更深——据我们所知,这是第一个联合应用Daubert和NIST SP 800-86取证标准来评估LLM水印的研究,建立在先前鲁棒性(Liang等人)和治理(Nemecek等人)工作的基础上。

**我们的立场。** 现有文献中有三条线索。Liang等人(2025 (https://arxiv.org/html/2607.16010#bib.bib4))问:水印有多鲁棒?Nemecek等人(2025 (https://arxiv.org/html/2607.16010#bib.bib5))问:为什么治理失败了?蒸馏攻击研究问水印痕迹是否能在模型转移后幸存(Panet al.2025 (https://arxiv.org/html/2607.16010#bib.bib10); Yiet al.2025 (https://arxiv.org/html/2607.16010#bib.bib11))。我们问了一个不同的问题:*水印证据真的能在Daubert听证会上幸存吗?* 对于我们测试的三种方法和配置,答案是否定的。

## 取证就绪评分框架

机器学习基准测试问:“水印检测平均而言有效吗?”法院需要知道的是不同的东西:“对于*这份特定的*证据,专家证人能否就能证明一个已知且稳定的错误率作证?”FRS框架是我们试图弥合这一差距的尝试。

### 设计原理

FRS将NIST SP 800-86的四个阶段映射到五个框架组件(证据收集、验证协议、FRS评估、证据报告模板和实施指南),并将Daubert的五个因素转化为可评分的标准。我们并非最先想到这一思路的人——Nemecek等人(2025 (https://arxiv.org/html/2607.16010#bib.bib5))独立地提出

相似文章

标记错误症状:评估医学文本中的LLM水印

arXiv cs.AI

本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。

Text AI watermarks will always be trivial to remove

Hacker News Top

The article argues that text AI watermarks are inherently trivial to remove, exploring the EU AI Act's watermarking requirements and the technical challenges of text steganography, including Google's SynthID approach.

针对封闭 LLM 的可证明检测的数据集水印

arXiv cs.LG

本文提出了一种针对封闭大型语言模型(LLM)的新型数据集水印方法。该方法利用词对共现模式,能够以可证明的方式检测模型训练是否使用了专有数据,即使这些数据在训练数据集中仅占极小比例。