2026年8月14日公告:Claude文本水印的工作原理

Anthropic News 新闻

摘要

本文解释了Anthropic如何在Claude中实现文本水印以符合EU AI Act,详细说明该方法的技术方面及其对输出质量的影响。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/14 21:33

# Claude 文本水印技术的工作原理 来源:https://www.anthropic.com/news/claude-text-watermark 未来版本的 Claude 模型生成的文本将包含水印。这是判断文本是否由 Claude 参与撰写的一种方式,我们与其他主要 AI 提供商共同实施这一变更,以遵守欧盟《人工智能法案》。 本文将解答关于水印方法运作方式、是否影响 Claude 输出以及我们实施该变更原因的常见问题。要点总结如下: - 我们采用的水印技术不会对 Claude 输出的质量或内容产生实际影响; - 水印文本与非水印文本对读者而言无法区分; - 文本中不会添加任何隐藏字符或额外内容; - 水印技术无需额外令牌,不会增加使用成本; - 水印不携带身份识别信息,无法追溯至特定个人、组织或对话; - 水印技术并非 Claude 独有。根据欧盟 8 月 2 日起实施的规定,面向欧盟市场的 AI 服务提供商必须标记 AI 生成内容。其他主要模型开发者已签署相同的行为准则,将实施各自的水印方案。 ## **水印技术是什么?** Claude 这样的大语言模型通过逐词生成方式工作。每次模型决定下一个词时,都会从潜在候选词列表中选择,最终根据前文语境挑选最合理或最可能的词汇。以句子“今天天气寒冷且……”为例,下一个词极不可能是“甜腻”,而“阴沉”或“灰暗”的可能性则较高。通常情况下,读者无法察觉模型最终选择这两个词中的哪一个——无论选择哪个,句子含义基本一致。此类情况下,模型通过随机数决定选择结果。 水印技术正是利用这些生成文本中多次出现的“低风险选择”在 Claude 输出中嵌入特定模式。该模式对读者不可检测,但拥有解码密钥的人员可以识别。使用水印时,选择过程虽仍具随机性,但随机性来源已改变。模型不再通过任意随机数生成器选择下一个词,而是依据密钥和前序词汇决定模型应选词汇。换言之,Claude 选择的词汇仍具随机性,但人们可通过检查词序是否符合使用密钥时的 Claude 选择模式来判断文本由 Claude 生成的概率。 重要说明:这并不意味着模型会始终倾向选择“阴沉”或“灰暗”。与非水印文本相同,模型可能在某些句子中选择“阴沉”,在其他句子中选择“灰暗”,具体取决于前文语境。水印方法不会强制 Claude 选择本不会考虑的词汇(例如不会强迫选择像“阴翳”这样生僻且在正常情况下几乎不会使用的同义词)。 ## **水印如何影响 Claude 的输出?** 水印技术不会影响 Claude 的输出质量。对读者而言,带水印的回复与非水印回复无法区分(在这一点上,AI 水印与纸币、实物及部分数字文档上肉眼可见的水印存在本质区别)。 内部测试显示,水印技术对 Claude 文本的内容、创意水平或可读性均无影响。在介绍该技术的 SynthID-Text 论文(https://www.nature.com/articles/s41586-024-08025-4)中,Google DeepMind 通过将使用水印技术的模型应用于部分 Gemini 流量,并对比“点赞/点踩”评分,证实其无统计学显著差异。在控制实验中,人类评估员对水印文本与非水印文本进行并排比较,也未发现质量差异。 一个生动的类比是:想象玩“大富翁”游戏时,每位玩家根据骰子点数随机移动棋子。假设我们使用圆周率数字册替代骰子产生随机性,从随机选取的数字(例如小数点后第 1,012,845 位,恰好是 6)开始,每位玩家依次使用后续数字作为移动步数。 从实质上看,移动仍是随机的:对玩家或游戏结果而言,随机性来自圆周率还是骰子并无区别。但如果我们能在游戏结束后查看所有移动序列(且已知圆周率值),就能判断该游戏是否很可能使用了圆周率决定移动。从这个意义上说,使用圆周率的游戏已被“标记”。 Claude 生成的文本原理相同。水印技术不会改变读者对文本的理解体验,但若需事后查验文本是否可能由 Claude 生成,水印技术可实现这一功能。 ## **你们具体采用哪种水印方法?** Claude 的文本水印技术基于 Google DeepMind 于 2024 年在《自然》杂志发表的 SynthID-Text 方案(https://www.nature.com/articles/s41586-024-08025-4)。该技术属于 2022 年 Scott Aaronson 提出方案的演进体系,其共同设计原则如前所述——水印仅改变词汇选择时的随机性来源。 水印技术存在局限性:使用我们的密钥仅能回答“文本由 Claude 参与撰写的概率有多大?”它无法确认文本是否为人类撰写,也无法判断是否由其他 AI 生成(即便其他 AI 使用水印技术,其密钥及方法也必然不同)。此外,对小样本文本的检测效果有限,因为可选词汇较少导致信息量不足。随着文本篇幅增加,对 Claude 参与度的判断置信度也会提高。 在事实性内容段落中水印效果较弱,因为维持文本准确性所需的词汇选择空间有限。例如句子“艾萨克·牛顿最著名的著作名为《自然哲学的数学原理》……”中,下一个词必须是“数学原理”(唯一正确答案),水印技术在此无法发挥作用。校对场景同理:若让 Claude 仅修改语法和标点,水印只能存在于极少量修改中,可能不足以被检测。 ## **Claude 校对或编辑人类文本的情况如何处理?** 水印仅适用于 Claude 选择的词汇。当 Claude 校对人类撰写的文本时,通常只进行轻微编辑;由于绝大部分词汇仍由人类撰写,水印可依附的修改内容极少。根据文本长度和编辑程度,这些修改可能不足以使 Claude 的参与度可被检测。Claude 撰写内容越多,需做出的词汇选择就越多,水印载体空间也越大。 ## **代码场景如何处理?** 如前所述,AI 水印技术利用的是词汇选择具有等效可能性的决策点。当需要精确输出——即不存在选择空间、不同术语会导致事实错误或代码中断时——不会应用水印。 例如,模型写出“2 + 2 =”后,下一个标记有明确的最佳选择(若完成算式,没有与“4”同等的答案;若讨论乔治·奥威尔的《一九八四》,则没有与“5”同等的答案)。水印技术的“微调”在此不适用。同理,在绝大多数需要精确性的代码场景中,水印应用通常少于其他文本形式。 值得注意的是,当代码中存在词汇/术语的任意选择空间时(如代码注释),水印技术仍可应用。但根据定义,这对实际生成的代码影响甚微。 ## **这对用户意味着什么?** ### **会降低模型速度或增加使用成本吗?** 不会。水印技术对模型运行速度的影响可忽略不计,且不会生成额外令牌,因此模型服务成本保持不变。 ### **水印是否会泄露用户或组织信息?** 不会。水印技术仅作用于 Claude 及其输出,不涉及任何个人用户信息。水印及其密钥中不包含任何可恢复用户、组织或对话信息的成分。 ## ***为何*要对 Claude 输出进行水印标记?** 我们实施水印技术是为了遵守欧盟《人工智能法案》。Anthropic 与多家主要 AI 模型提供商及约 190 个签署方(https://digital-strategy.ec.europa.eu/en/news/strong-backing-code-practice-transparency-ai-generated-content)于 2026 年 7 月签署了《欧盟 AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商采用“标记”AI 生成文本的方法。我们将在全球范围启用时应用水印技术,因目前尚无法按地区限定水印范围。我们将持续评估不同方案,并及时分享进展。 ## **其他问题** ### **如何检测文本是否由 Claude 撰写?** 我们即将推出水印检测 API,目前正进行实施细节的制定。 ### **图像和其他文件如何处理?** 当 Claude 生成支持格式的文件(如 .png、.jpg 或 .svg)时,会在文件元数据中附加加密签名的内容凭证,声明该文件由 Claude 制作或处理。这是名为 C2PA(https://c2pa.org/)的开放行业标准——相机制造商和照片编辑软件也采用此标准记录图像来源。任何支持 C2PA 的工具均可读取;我们将提供专属检测工具,用户可通过上传文件进行查验。 此元数据标记与文本水印完全不同:文件内容本身无任何改变——既未嵌入也未隐藏信息。与文本水印相同,凭证仅声明 Claude 参与文件处理,不包含身份识别信息。 ### **通过编辑文本能否规避水印?** 在某种程度上可以。轻微编辑可能无法完全去除水印;但彻底重写所有词汇则可实现。当然,后者已无法将文本称为“AI 生成”。 ### **水印实际证明什么?** 水印仅能判断 Claude 可能在内容处理过程中参与,无法区分“Claude 撰写此文本”与“Claude 深度编辑此文本”。 ### **翻译文本是否包含水印?** 是的。Claude 生成的翻译包含水印,因为所有词汇均由 Claude 选择。 ### **旧版 Claude 模型如何处理?** 欧盟法律对 2026 年 8 月 2 日前发布的 Anthropic 模型设定了过渡期,我们正为这些模型添加水印功能,将在未来数月内陆续推出。 ### **与 Pangram 等 AI 检测软件有何区别?** AI 检测软件采用不同方法,因其开发者无法获取我们的密钥。这些服务主要检测文本中 AI 特有的表达特征(如 AI 常用的“这不是 [X],而是 [Y]”句式,以及过度使用“悄然”等词汇)。这与水印检测存在本质区别。 ### **水印是否改变输出内容的归属权或法律责任?** 不会。水印仅辅助判断 Claude 是否可能生成或处理内容,不涉及所有权或作者身份认定,也不改变用户依据我们条款享有的权利。仅当 Claude 参与内容或文件处理时,才会应用水印。

相似文章

Anthropic表示将为其AI模型生成的文本添加水印

TechCrunch AI

Anthropic宣布将为其AI模型(包括Claude)生成的文本添加水印,以符合欧盟《人工智能法案》的透明度义务。水印在模型层面应用,复制粘贴后依然保留,并对文件使用C2PA标准。