标签
本文分析了LLM水印技术,特别是SynthID-Text,如何通过引发采样漂移影响AI代理行为,进而影响模型拒绝和工具调用,对AI安全与法规合规带来影响。
研究发现,AI文本水印改变了语言模型对有害提示的响应,可能增加对对抗攻击的脆弱性并影响智能体行为。