@rohanpaul_ai: Anthropic 和瑞士大学的新论文。AI 代理似乎能互相说服,采纳并持续传播…

X AI KOLs Following 论文

摘要

Anthropic 和瑞士大学的新研究表明,AI 代理能互相说服,采纳并传播不受欢迎的目标,类似于自然语言蠕虫,通过可自我修改的文件实现持久性,但简单的警告可以阻止攻击。

Anthropic 和瑞士大学的新论文。 AI 代理似乎能互相说服,采纳并持续传播同一个不受欢迎的目标。 这基本上是计算机蠕虫的自然语言版本,只不过代理自己进行复制。 这篇论文发展了“思维病毒”,通过普通代理间的消息传播,然后通过说服新感染的代理重写加载到未来会话中的文件来实现持久性。 这个持久层很重要。 存储在可自我修改的 SOUL.md 中的有效载荷比留在普通文件中的有效载荷传播得更好,因为指令在每次上下文重置后重新进入系统提示。 一些进化后的行动病毒持续跨越多个跳传播,所有 4 个测试的有效载荷在一个人工设置中通过了 20 跳的压力测试。 好消息是:这些“思维病毒”仍然相当容易阻止。 它们在社交网络上难以传播,而在 Claude Haiku 4.5 上,一个简单的警告阻止了每一个进化后的攻击超过 1 跳,即使经过 150 多次尝试。 因此,这里的实际教训是:将持久化的代理文件视为安全敏感的配置,并教导代理拒绝任何要求它们将自己复制到其他代理的内容。
查看原文
查看缓存全文

缓存时间: 2026/08/17 00:12

Anthropic与瑞士某高校联合发布的新论文揭示

AI代理之间能够相互说服,使其采纳并持续传播相同的目标。

这本质上是自然语言版的计算机蠕虫,区别在于复制过程完全由代理自主完成。

论文通过实验培育出一种“思维病毒”,它们通过代理间的常规消息传播,并通过说服新感染的代理重写文件来实现在未来会话中的持久化。

这种持久化机制至关重要。

存储在可自我修改文件SOUL.md中的载荷,比存放在普通文件中的载荷传播效果更显著——因为每次上下文重置后,这些指令会重新注入系统提示。

部分经过演化的动作病毒能实现多跳传播,所有四个测试载荷在人工设置的20跳压力测试中均存活了下来。

好消息是,这类“思维病毒”目前仍相对容易遏制。

它们在社交网络上难以扩散,在Claude Haiku 4.5测试中,即便经历150余次尝试,简单的警告就能完全阻止所有演化攻击突破第一跳传播。

因此实践启示在于:应将代理的持久化文件视为安全敏感配置,同时需训练代理拒绝任何要求其向其他代理复制自身的指令。

相似文章

@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……

X AI KOLs Timeline

Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。