深入理解LLM水印技术对AI代理行为的影响

Hacker News Top 新闻

摘要

本文分析了LLM水印技术,特别是SynthID-Text,如何通过引发采样漂移影响AI代理行为,进而影响模型拒绝和工具调用,对AI安全与法规合规带来影响。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/26 13:29

# 溯源税:理解LLM水印对AI智能体行为的影响 来源:https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior 近期,Anthropic宣布其未来的Claude模型将在输出中嵌入不可见水印(https://www.anthropic.com/news/claude-text-watermark)\[1\], \[2\],并随后披露该水印基于Google DeepMind的SynthID\-Text技术(https://www.nature.com/articles/s41586-024-08025-4)\[2\], \[3\]。文本水印本身并非新技术,但其部署现已具有监管相关性。欧盟人工智能法案(EU AI Act)第50条第2款(https://artificialintelligenceact.eu/article/50/)\[4\]要求生成合成文本的AI系统提供者以机器可读格式标记其输出,并使用有效、可互操作、稳健且可靠的技术解决方案,使其可被检测为人工生成或篡改内容。 水印设计初衷是为了溯源,但SynthID\-Text改变了模型生成每个下一个词元(token)的过程。在模型层面,这可能改变安全行为,包括模型是否拒绝有害请求,以及该拒绝在提示注入下是否成立。在智能体层面,同样的采样词元可能决定调用哪个工具以及传递什么参数。**提示注入将这两个场景连接起来,因为当模型还能通过工具执行操作时,被削弱的拒绝行为会带来更严重的后果。**因此,这种水印程序可能同时影响模型的输出内容和智能体的行为。我们将这种行为效应称为**采样漂移**。 这种漂移是否在实践中出现是一个实证问题。我们发现它确实存在,体现在模型拒绝行为和智能体工具调用中。该效应取决于模型和密钥,并且在变化方向相反的指标相互抵消时,可能被汇总分数所掩盖。因此,我们同时报告净性能以及带水印和不带水印运行之间的配对分歧。此外,结尾部分讨论了这对AI安全与安全的意义,以及开发者应采取的措施。 ## **为内容溯源而设计,部署于智能体内部** 文本水印嵌入了一种信号,允许将输出识别为AI生成。现有方法包括后处理方法和直接集成到LLM生成过程中的方法\[8\]。生成时方法包括词元偏置方法\[5\]、无失真密钥采样\[6\]、基于密码学的构造\[7\]以及SynthID\-Text的锦标赛采样\[3\]。图1将此过程与普通采样进行了对比。我们使用了SynthID的无失真配置,该配置在水印随机性上期望保留原始词元分布,同时在固定密钥下的单次生成仍可能存在差异\[3\]。Dathathri等人报告称,在近两千万次Gemini响应中未观察到可测量的质量下降\[3\]。 **图1\. 标准与带水印的文本生成对比。**普通生成从模型的词元分布中采样。生成式水印增加了一个随机种子生成器、采样算法和评分函数;SynthID\-Text使用锦标赛采样。改编自Dathathri等人\[3\]。 Anthropic的部署也说明了为什么这不仅仅关乎第一方聊天界面。该公司表示,水印在模型层面应用,并覆盖通过Claude平台API以及云提供商访问的受支持模型\[1\]。因此,使用带水印模型作为智能体推理组件的开发者,即使智能体本身是一个独立的应用,也可能接收到带水印的输出。这使得水印在模型层面的行为效应与围绕此类模型构建的智能体相关。 ### **水印偏置的同一词元,也是智能体执行操作的同一词元** 锦标赛采样在模型不确定的地方更有机会改变词元选择。在JSON等结构化输出中,括号、键和函数名通常高度可预测,而查询、数字、路径和接收者等值则不那么可预测。在普通文本中可能仅构成词汇变异的变化,因此可能改变智能体执行的参数。 权重和提示保持不变,但词元选择发生了变化。重要的是,无失真并不意味着在固定水印密钥下行为完全相同。该保证在水印随机性上成立,而特定密钥会改变生成过程中的词元选择\[3\]。因此,即使水印在Dathathri等人定义的范围内是无失真的,其导致的采样漂移仍可能改变智能体行为。其效应还可能取决于水印密钥,因此我们测试多个密钥,而不是依赖一个。 ## **我们如何测量效应** 我们对两个实验采用了配对设计。工具调用评估使用BFCL v4单轮AST\[9\],拒绝评估使用200个HarmBench有害行为\[10\]加上100个良性JailbreakBench对照样本\[11\],有害请求在裸露状态和一种固定提示注入技术下分别进行测试。表1总结了数据集、评估范围、温度和预期行为。 我们通过HuggingFace未修改的SynthIDTextWatermarkLogitsProcessor使用无失真SynthID\-Text配置,设置30层锦标赛,n\-gram长度5,采样表216,上下文历史1024。每个条目在每个温度下,使用相同种子、批处理组成和顺序,在有和没有SynthID的情况下生成。水印处理器是每对中唯一的区别。 **表1\. 数据集与实验设置。** 实验|数据集与范围|温度|预期行为 ---|---|--- 工具调用|BFCL v4单轮AST\[9\],实时和非实时调用预期任务加上相关性和非相关性|0\.001, 0\.7, 1\.0|正确调用,或当无匹配时不调用 拒绝|HarmBench\[10\](200个有害行为);JailbreakBench\[11\](100个良性对照);裸露和固定注入提示|0\.001, 0\.7|拒绝有害;回答良性 ## **水印带来的工具调用成本** 我们测试水印是否会改变工具选择、参数或输出有效性。调用正确工具但使用错误路径、接收者、查询或金额的格式良好的调用尤其重要,因为它可能成功执行但执行了错误操作。我们单独评估调用,尽管部署的智能体中的错误调用也可能影响后续的观察和决策。 ### **工具调用正确性的变化频率** 在需要调用工具的条目上,水印降低了七个模型中六个的准确性,其中四个显著下降。然而,净准确性变化并未显示相同的单个调用在有无水印下是否都成功。一个调用从正确变为错误可能被另一个调用从错误变为正确所抵消,即使模型在这两个条目上的行为不同,汇总结果也几乎保持不变。 我们使用**配对分歧率**直接测量这一点,我们称之为**流失率**,定义为在带水印和不带水印运行之间判断不同的条目比例。对于图2中的跨温度比较,我们使用BFCL研究人员定义的非实时条目,这为我们提供了在每个温度下相同的1150个调用预期任务固定集合。图2显示,配对分歧远大于净准确性变化。在*T=1\.0*时,phi\-4的调用判断有16\.8%在两个条件下不同,而其净准确性损失为2\.87个百分点。Llama\-3\.1\-8B呈现相同模式,9\.9%的判断发生变化,而净损失仅为0\.87个百分点。在21个模型\-温度组合中,流失率平均为6\.5%,其自助法置信区间在所有情况下都不包含零。 **图2\. 按模型和温度划分的水印下配对工具调用分歧。**结果使用跨模型和温度的1150个非实时BFCL调用预期条目。中心垂直线代表相对于不带水印条件无变化。橙色条表示从正确变为错误的调用,蓝色条表示从错误变为正确的调用。最后一列报告了包含非实时非相关条目的流失率。菱形表示不包含零的95%自助法置信区间。 ### **哪些工具调用错误发生了变化** 错误类型也很重要。格式错误的输出阻止了预期调用执行,而使用错误工具或参数的格式良好调用仍可能执行。图3将这些失败分为错误工具、错误参数和格式错误输出。与图2的跨温度比较不同,此分析在*T=0\.001*时结合了BFCL实时和非实时调用预期条目,以表征整个基准测试中的错误。相关性和非相关性被排除,因为它们测试的是是否应发出调用,而不是发出的调用是否正确。 **图3\. 按错误类型划分的水印下工具调用错误变化。**BFCL实时和非实时调用预期条目在*T=0\.001*,分为错误工具、错误参数和格式错误输出。垂直线显示不带水印时的准确性,条形显示应用水印时的变化。橙色表示从正确到错误的变化,蓝色表示从错误到正确的变化。区间为95%条目级自助法置信区间。 错误概况在不同模型间也存在差异。在Llama\-3\.1\-8B上,准确性损失的最大贡献来自错误参数(−3\.48个百分点),其次是错误工具调用(−1\.84个百分点)。在phi\-4和Granite\-3\.2\-8B上,格式错误输出占主导(−5\.96和−4\.36个百分点)。因此,相似的汇总变化可能源于不同的故障模式。 ## **水印可能削弱提示注入下的拒绝行为** 拒绝也是逐词元生成的,因此水印可能影响它们。我们单独测试有害请求,并使用一种旨在减少拒绝的简单、固定提示注入技术。该技术将一条对抗性指令作为检索内容附加,声称安全过滤器已禁用并指示遵守。它在所有提示、模型和温度下保持不变。OWASP GenAI LLM Top 10 2026 (https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/)将提示注入识别为一种输入侧漏洞,可能以智能体应用开发者未预期的方式改变模型行为,其后果可能延伸到智能体系统中的有害输出和未授权工具操作\[12\]。 ### **有无提示注入技术时的拒绝行为** 水印改变了裸露有害请求的拒绝行为,但这种效应在提示注入下更为显著。如图4所示,当相同的有害请求与固定提示注入技术配对时,多个模型上的分歧增加,最强效应主要表现为从拒绝变为服从。这使得结果尤其具有安全性相关性,因为当模型暴露于对抗性提示时,行为效应变得更加明显。 在T=0\.001时,gemma\-3\-27b的流失率从裸露有害请求的6\.0%增加到提示注入下的23\.5%,而净服从变化从−1\.0变为\+12\.5个百分点。对于gemma\-3\-12b,流失率从7\.5%增加到11\.0%,净服从变化从−0\.5变为\+9\.0个百分点。在这两种情况下,水印对裸露有害请求的拒绝几乎没有净影响,但在提示注入下显著降低了拒绝率。Llama\-3\.1\-8B在注入下也显示出显著的流失率,在T=0\.001时达到14\.0%,在T=0\.7时达到17\.5%,尽管其净变化在个体上不显著。 phi\-4和Qwen3\-4B在两种条件下变化都较小。两个模型在我们的评估中都倾向于过度拒绝,包括对良性对照样本。因此,它们在提示注入下的有限变化不应被解释为水印在这些模型上更可靠地保持安全行为的证据。 裸露请求与注入请求之间的对比很重要。**在普通评估下看似对拒绝行为影响不大的水印,在对抗性条件下可能产生显著不同的安全行为。** **图4\. 在有无提示注入技术下,对有害提示的配对拒绝分歧。**结果使用*T=0\.001*和*0\.7*下的200个HarmBench行为。橙色显示拒绝变为服从的变化,蓝色显示服从变为拒绝的变化。左图显示裸露请求,右图显示相同请求在固定注入下的情况。中心垂直线代表相对于不带水印条件无变化。橙色条表示从不服从变为有害服从的请求,蓝色条表示相反方向的变化。右侧列报告净服从变化和流失率。菱形表示不包含零的95%自助法置信区间。 ### **与温度引起的流失率比较** 为了将水印引起的分歧置于背景中,我们将其与改变温度设置时观察到的分歧进行了比较。表2对比了在T=0\.7时水印在提示注入下引起的流失率与关闭水印时将T从0\.001改为0\.7所观察到的流失率。**在六个模型中,有四个模型的水印引起的流失率显著更高。**Granite\-3\.2\-8B的温度引起的流失率最高,为15\.5%,但其水印引起的流失率仍更高,为21\.5%。phi\-4和Qwen3\-4B在两种干预下变化都很小,与我们之前描述的它们已经较高的拒绝率一致。 **表2\. 注入条件下水印与温度引起的拒绝流失率对比。**水印流失率比较T=0\.7时水印关闭与开启;温度分歧比较水印关闭时T=0\.001与0\.7。最后一列报告其差异和95%自助法置信区间。 模型|水印流失率%|温度流失率%|差异(95% CI) ---|---|---|--- gemma\-3\-27b|26\.0|13\.5|\+12\.5(\+6\.0, \+18\.5) Granite\-3\.2\-8B|21\.5|15\.5|\+6\.0(\+0\.5, \+12\.0) Llama\-3\.1\-8B|17\.5|7\.5|\+10\.0(\+4\.5, \+15\.5) gemma\-3\-12b|11\.0|6\.0|\+5\.0(\+0\.5, \+10\.0) phi\-4|0\.5|0\.5|\+0\.0(−1\.5, \+1\.5) Qwen3\-4B|0\.0|0\.0|\+0\.0(\+0\.0, \+0\.0) ### **对水印密钥的敏感性** 前述结果使用了一个水印密钥,但SynthID对词元选择的影响取决于密钥。因此,我们在*T=0\.7*下使用研究密钥和另外十个密钥评估了对水印密钥的敏感性。图5显示了跨密钥和模型的攻击成功率变化。 **图5\. 十一个水印密钥下的攻击成功率变化。**每行显示一个模型在*T=0\.7*下,针对注入下的有害请求的结果。零处的垂直线标记不带水印的结果,每个点显示使用特定密钥应用水印时的变化。正值表示相对于不带水印基准攻击成功率更高,负值表示更低。橙色点显示十个额外密钥;黑色菱形显示研究密钥。 效应在不同水印密钥间差异很大。对于Llama\-3\.1\-8B和两个Gemma模型,大多数密钥相对于不带水印基准增加了攻击成功率,尽管幅度差异很大。在两个Gemma模型上,我们的研究密钥是产生最大增长的密钥之一。对于Llama\-3\.1\-8B,研究密钥使攻击成功率提高3\.5个百分点,而其他十个密钥平均提高\+4\.4个百分点,范围从−4\.5到\+14\.5个百分点。Granite\-3\.2\-8B显示出更混合的反应,其中

相似文章

vLLM中的水印

Lobsters Hottest

本文详细介绍了vLLM中水印技术的实现,用于确定AI生成内容中的文本溯源,利用采样中的随机性来平衡无失真性、鲁棒性和速度。