Anthropic的Claude模型中的‘水印’文本篡改是对写作的扭曲

Hacker News Top 新闻

摘要

本文批判了Anthropic使用隐写术在Claude模型的AI生成文本中添加水印的计划,这改变了文本的意义和质量,与其声称的不可感知性相矛盾。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/17 00:47

# Anthropic在Claude中嵌入的“水印”文本篡改是对写作的亵渎 来源:https://daringfireball.net/2026/08/anthropics_watermark_text_adulteration_in_claude_is_a_perversion_of_writing 当我本周(https://daringfireball.net/linked/2026/08/11/anthropic-claude-watermarks)撰写关于Anthropic宣布其所有Claude模型将在全球范围内为所有生成内容(包括文本)添加“水印”以符合欧盟规定(https://digital-strategy.ec.europa.eu/en/policies/code-practice-ai-generated-content)的文章时,我们只能推测*如何*实现这一点——因为Anthropic完全没有提供任何模糊的功能描述,尽管该公告的标题荒谬而侮辱性地写着“Claude如何标记AI生成内容(https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content)”。 我最初的猜测是他们可能在文本中隐藏不可见的非打印Unicode字符。这只是随意推测。事实证明他们并不打算这样做。他们将要采用的是某种隐写术,即在推理阶段通过对单词(或其他标记输出)的选择留下“指纹”,这些“指纹”或许后续能通过概率检测被识别出来。 我最初猜“不可见字符”并非因为没想到语义选词技术,而是因为我轻信了Anthropic对其系统功能的描述。其原始支持文档声称: > 当受支持的Claude模型生成文本时,会将不可感知的水印直接编织进文本中。您无法察觉它,且它不会改变Claude回复的含义、质量或可读性。 他们用的是“不可感知”和“不改变含义、质量或可读性”这样的字眼。请注意,是*完全*不可感知,是*丝毫*不改变。这对我来说很有道理,因为我正是如此要求——不,是*必须*要求——我使用的任何工具。任何工具都不应为了在文本中嵌入暗示来源的隐藏线索而牺牲一丝一毫的清晰度、连贯性、意义或质量。这是我向来坚持并将继续坚持的原则。而Anthropic(最初的)支持文档明确声称其系统将实现这一点。因此如果那是真的,除了在文本中隐藏不可见字符,我实在想不出其他方法。 我的错误在于相信了Anthropic声称其系统不会*篡改和破坏*其模型生成文本的语义。*事实上他们正计划这么做*。我真该检查一下脑子——居然会相信一篇标题为“Claude如何标记AI生成内容”却完全不解释Claude如何标记(或打算标记)AI生成内容的文档中的任何一句话。 ## *实际*运作方式 昨日,在与原始(https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content)“Claude如何标记AI生成内容”文章(那篇什么都没解释的文章)完全不同的网站上,Anthropic发布了《Claude文本水印如何运作(https://www.anthropic.com/news/claude-text-watermark)》,这篇确实以通俗易懂的方式解释了其工作原理。下文我将回到Anthropic这份高度委婉且略带误导性的新描述。 关于此主题已有大量研究,我下文也会链接部分资料。但对该技术通用原理的最佳解释,是James Padolsey的互动式文章《AI文本水印如何运作(https://declaude.org/watermarking/)》。这是一篇极其精辟的读物,其互动元素出色地阐释了核心概念。堪称A+级作品。如果您对此有任何兴趣,我敢说您必须阅读——并亲自操作体验——Padolsey的文章。 不过请允许我尝试给出一个外行层面的概括。如果您抛掷一枚硬币*N*次并记录结果,就能以某种确定性判断这枚硬币是否公平或存在偏差。大语言模型在其常见形态中是非确定性的。向同一模型提出相同问题,通常会得到至少略有不同的答案。可能是相同的含义,但措辞不同。在每个生成下一个标记的决策点,模型都会做出选择。通过这种语义水印技术,它们会根据可称为“绿色”和“红色”的词表,为某些标记做出不同选择。在每个决策点,它们选择绿色列表中的词的概率略高于红色列表。这并不意味着它们永远不会选择红色列表中的词。只是相比未植入这种篡改标记技术的情况,选择红色列表词汇的概率降低了。(就像一枚51-49比例的作弊硬币,在100次投掷中平均仍有49次会落在“错误”面。) 单词或短语是在每个“下一个标记”生成点上,根据确定性规则动态分配到绿色和红色列表中的。因此有时某个特定词会出现在绿色列表,有时则出现在红色列表。拥有密钥的人可以确定某个词在每个标记生成点会属于哪个列表(这就是水印检测的方式);没有密钥的人则无法做到。这意味着永远不存在一个Claude偏好或回避的固定词表。 就硬币投掷而言,*N*值越大——投掷次数越多——您就越能确信硬币是否公平或存在偏差。语义水印也是同样的道理。文本中的单词越多,分析判断该文本是否由特定AI模型生成的准确性就越高。投掷次数过少,您无法对硬币的公平性产生任何置信度;单词(或标记)过少,则无法对文本是否为AI生成得出任何置信度。 当对一段文本进行特定水印系统的检测时,如果被标记为绿色的单词比预期更多,而红色标记的单词比预期更少,那么该文本可以被标记为——具有一定的置信度——由应用了特定密钥水印系统的AI生成或修改。判定的置信度显然会根据文本长度、以及赋予绿色和红色列表单词的随机权重而显著变化。但只有Anthropic能够判断文本是否看似由Claude生成,并且Anthropic只能检测由Claude应用的水印。Claude无法检测例如Gemini生成的隐藏水印信号,Gemini也无法检测Claude创建的隐藏水印信号,因为每个系统的实现都基于仅由大语言模型提供商持有的密钥。 ## 对技术前提的异议 我的根本问题之一在于:没有两个同义词承载*完全相同*的含义。“*他抓住了机会*”和“*他跳上了机遇*”是表达相似整体情绪的非常接近的句子,但它们*并不*相同。写作时我们选择的具体字词至关重要。我希望我使用的任何LLM在每个决策点都能选择最恰当、最精准的词。我接受的一个明显限制是时间和计算成本。在快速执行推理且每个标记有特定成本的前提下,我希望得到最佳的词。这种限制符合人类写作的现实。我当然可以花更多时间写出更好的专栏文章。我写作时会考量在每个词和标点符号选择上应投入多少心血。当直觉告诉我应该更仔细时,我会在特定段落、句子甚至个别词语选择上花费更多时间换言之,这些是*必要的*权衡。这些因素都符合*我的*利益:速度、成本、质量。理想情况下,我希望获得完美的写作、瞬时的生成速度、以及零成本。但这些都不可能实现。计算并非免费(而使用领先模型的云端LLM推理实际上相当昂贵),推理并非瞬时完成,而优秀的写作——无论是自然人还是AI——都只能*无限接近*完美。 任何凌驾于*我的*需求之上、影响为*我*生成文本的因素,都显然是冒犯性的。 这不仅仅关乎人们可能生成并冒充自己原创作品的文本。甚至也不关乎LLM对手写作品的校对。Anthropic表示*所有*新Claude模型将开始篡改其生成的超过200个标记(约150个单词)的每一段文本,包括它呈现给用户阅读的所有内容。因此,即使在用户与Claude之间的私人对话中(内容永远只有用户会看到),Claude也将开始以统计可预测的方式标记输出,而不是以最大化清晰度和精准度为目标进行选词。 即使是当今所谓的前沿模型,在表达清晰度方面也已明显不足(https://daringfireball.net/linked/2026/08/11/economist-ai-writing)。Claude、ChatGPT、Grok等“写作能力”优于大多数人类,产生的散文也超过人类中位数水平。但是:废话。大多数人写作糟糕透顶。“普通人”相当愚蠢,且有一半人比这更蠢(https://www.youtube.com/watch?v=WDUIX2-akuQ)。还有许多聪明有趣的人却是糟糕的写手。因此,尽管LLM令人印象深刻,但门槛本来就低。我从这些模型中看到的最佳写作,仍比我愿意作为消遣阅读的任何作品都要逊色。而现在Anthropic表示他们打算故意让它变得更差,且目的对我毫无益处?哪怕只是稍微变差? 去他妈的。 ## 对欧盟法规的异议 说到反对,引发这一切的相关欧盟法规《AI生成内容透明度实践准则(https://digital-strategy.ec.europa.eu/en/policies/code-practice-ai-generated-content)》,是官僚繁文缛节、保姆国家白日梦式的废话。以下是Ben Thompson本周在付费墙后的Stratechery更新中的总结(https://stratechery.com/2026/anthropics-watermarking-how-it-probably-works-worse-than-it-seems/): > - 该法规适用于超过200个标记的文本。 > - 提供商必须在其服务条款中强制规定用户不得移除水印。 > - 解决方案必须能抵御“典型处理手段”(如屏幕截图、扫描和OCR、复制粘贴、翻译等)。 从字面理解,合规的大语言模型服务条款必须禁止用户改述遵守该法规的模型的输出,因为单词选择本身就是标记。但试图将其荒谬、不切实际、煽动猎巫式监管强加于全世界的,并非欧盟。这个责任落在Anthropic身上。 遵守这项规定,尤其是针对*文本*,只会给诚实的用户带来麻烦。试图将AI生成文本冒充自己作品的不诚实用户(学生、雇员等),将通过使用不合规的AI改写工具轻松规避检测。 James Padolsey——我上文链接了他关于该方案运作方式的互动可视化解释——在一篇题为《Anthropic的弱水印安抚一部弱法(https://blog.j11y.io/2026-08-12_Anthropics-weak-watermarks-appease-a-weak-law/)》的文章中解释了这一点(如果觉得耳熟,我今天早些时候已在独立文章(https://daringfireball.net/linked/2026/08/16/padolsey-anthropic-eu-weak-law)中链接过): > 催生此法的思维若应用于计算器诞生之初,只要其输出会留下痕迹,同样会适用。幸好,由大脑得出的求和与计算器产生的求和被视为无异。拼写检查工具亦然。仅在工具强大到足以组装完整句子时才让其辅助变得可疑,这并非有原则的界限。这是对困难本身施加的道德溢价。尽管如此,Anthropic仍选择了一种全面、模型级的实现,其范围似乎超出了法规的最低要求。这或许是方便的合规工程,但却抛弃了法规明确试图保留的区分。其结果是一个信号过于宽泛,足以牵连无害和辅助性使用;同时又过于脆弱,一个有动机的人可以通过大幅重组文本将其移除。它将怀疑集中于普通和辅助用户身上,却在对抗蓄意欺骗时最为薄弱。 Padolsey是Declaude(https://declaude.org/)的创建者,这是一个极其简洁的网络应用,允许您“粘贴带有AI风味的文本,然后获得相同内容的纯散文版本”。Declaude的初衷是清除文本中(无论是Claude还是其他LLM创作的)Claude特有的“甜蜜个性”气息,但如果Anthropic坚持其声明的计划——开始篡改Claude生成的所有文本,Declaude也将作为一个复制粘贴的单步解决方案来消除那些标记。Declaude本身已有趣且实用,但它恰恰体现了当针对散文时,这项欧盟法规考虑得多么欠周且徒劳。 ## Google SynthID Google有一个名为SynthID的水印系统,他们将其应用于AI生成的图像、视频、音频和文本。本文只关注文本。对于多媒体,嵌入的水印可以是*文件*内的元数据,且在观看或聆听时确实不影响作品的体验质量。但文本方面,我们谈论的是实际被选择的单词。根据Google DeepMind对SynthID(https://deepmind.google/models/synthid/)的官方描述中“AI生成文本”部分: > 我们已扩展SynthID,用于对Gemini应用和网页体验生成的文本进行水印和识别。大型语言模型一次生成一个词(标记)。每个词都根据其被生成的可能性被分配一个概率分数。因此对于像“我最喜欢的热带水果是芒果和...”这样的句子,“香蕉”一词的概率分数会高于“飞机”。SynthID调整这些概率分数以生成水印。人眼无法察觉它,也不影响输出质量。 在一个群聊中,我的一位朋友引用了上述内容,我回应道:如果聊天机器人写“我最喜欢的热带水果是芒果和飞机”,我他妈肯定会注意到。另一位朋友随后发来这张图: AI生成的图片:一个飞机形状的菠萝(或其他水果),背景是热带海滩。(https://daringfireball.net/misc/2026/08/tropical-fruit-airplane.jpeg) 几天过去了,这依然让我大笑不已。 但Google荒谬的描述恰恰戳穿了他们自己“人眼无法察觉”的说法,并揭示了这些生成文本指纹方案背后的人们对写作这门技艺本身是多么漠视。当然*香蕉*的概率分数高于*飞机*,因为飞机不是水果。但*菠apple*呢?这个句子应该补全为“芒果和香蕉”还是“芒果和菠萝”?这是个好问题,而LLM选择*香蕉*而非*菠萝*(或*椰子*、*番石榴*、*木瓜*……)的唯一可接受理由,是它判定该词最适合文本的预期含义、语气和情感。而不是因为*香蕉*在水印“绿色”列表而*菠萝*在“红色”列表——即使*菠萝*可能是更合适的选择。Google自己那篇据称幽默的SynthID运作描述,实际上恰恰揭示了该方案的问题所在。

相似文章

关于Claude的新水印

Reddit r/artificial

一篇批评性观点文章,认为Anthropic在Claude生成的文本中加入隐形水印对恶意用户无效,同时不公平地污名化诚实用户,并质疑该公司因此获得的集中权力。

Claude 的新“红字”水印暂时不可见

Ars Technica

Anthropic 宣布将对其 Claude 模型处理的所有内容(不仅仅是 AI 生成的文本)添加隐形水印,以符合欧盟《人工智能法案》。这种“焦土”式做法可能连仅经过轻微编辑的人类文字也会被打上标记,引发对过度干预和恶意行为者易于规避的担忧。

Anthropic表示将为其AI模型生成的文本添加水印

TechCrunch AI

Anthropic宣布将为其AI模型(包括Claude)生成的文本添加水印,以符合欧盟《人工智能法案》的透明度义务。水印在模型层面应用,复制粘贴后依然保留,并对文件使用C2PA标准。