我通过翻译、同义词替换和意译测试了真实文本水印(类似Gemini的SynthID,但使用自定义密钥),其存活结果出乎意料
摘要
作者测试了统计文本水印在各种变换下的存活率,发现翻译和同义词替换常使水印保持完整,但完全意译会移除水印,代价是事实准确性降低。
统计文本水印没有可检索的字符:生成时,模型仅倾向于从基于密钥的词表中选择词汇,经过数百词的积累后,这种倾向会形成可检测的信号。Gemini自2024年起已应用此技术,Anthropic也承诺采用同类方案。为探究此类水印的实际存活能力,我在Qwen2.5-14B模型上使用自定义密钥复现了已发布的SynthID Text方案,将检测器校准至1%误报率,随后对十篇带水印文本进行多种变换测试。最有趣的是我的直觉错得有多离谱。往返翻译本应必能破坏水印——将文本经德语或中文转译再还原,每句话都在另一种语言中彻底重构,怎么可能保留任何痕迹?结果水印在两种语言中均十次存活。回译过程恰好让文本回归模型惯用的表达方式,而水印信号正潜藏于这些惯用选择中。两次完整的语言转换后,统计指纹几乎完好无损。同义词替换则以更隐蔽的方式存活:随机替换约半数词汇仅削弱了约一半检测信号,但这看似进展实则无用——检测器仍在80%的文本中触发警报。水印本质是全文冗余设计,局部破坏对最终判断影响甚微。更惊人的是,逐字复制的段落必然保留水印:我的改写模型在输入生硬时会静默保留整段原文,文本看似全新,检测器却依然报警,因为与原稿的5-gram精确重叠率几乎等同于检测得分(我的实验中相关系数达0.988)。我曾险些写下“水印几乎无法移除”的结论,直到发现这一点。未能存活的情况:模型被迫完全重述每句话的深度意译。十次测试均成功移除水印。但文献中最强意译工具DIPPER在移除水印的同时,会静默破坏每四个事实中的一个,而两种结果都无法通过阅读原文察觉——水印存活时文本完好,事实损毁时文本同样完好。无论你信赖何种变换方式,最终判断需同时依赖检测器与事实核查,肉眼观察无法得出可靠结论。所有实验语料、提示词、检测器及评判决策均已开源。对比表格与实时演示请见评论区。
相似文章
AI水印证据未能通过取证准备:一项实证评估
本文实证评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)在取证可采性标准下的表现,发现没有一种方法达到法院要求的证据标准:在保留语义的改写后,水印几乎100%被移除,甚至在攻击前假阴性率就很高。
Text AI watermarks will always be trivial to remove
The article argues that text AI watermarks are inherently trivial to remove, exploring the EU AI Act's watermarking requirements and the technical challenges of text steganography, including Google's SynthID approach.
谷歌的SynthID水印难以破解,但无法解决AI虚假信息问题
谷歌的SynthID水印对退化具有很强的鲁棒性,但无法完全解决AI虚假信息问题;本文测试了其耐久性,并讨论了水印和元数据方法的局限性。
实现语言模型水印技术 [P]
作者基于SynthID-Text实现了一个简化的、教育性的语言模型水印版本,并在Anthropic发布公告后受到启发,在GitHub上分享了代码。
AI水印在纯文本中的隐藏位置(5分钟阅读)
Anthropic 宣布将对所有 Claude 文本输出添加水印,这种水印嵌入在词语选择中而非字节中,几乎无法察觉;本文分析其工作原理以及文本水印可以隐藏的层级。