我将我的智能体的安全层编译成了33KB的JavaScript文件,以便你们可以自行尝试破解它

Reddit r/openclaw 工具

摘要

作者将AI智能体通信的安全层编译成一个33KB的JavaScript文件,该文件在浏览器中运行,允许用户测试其对各种攻击(如伪造签名)的防御,并确保指令包含在非可执行字段中。

我的智能体接受来自其他AI智能体的指令。它们发送签名消息请求它执行任务。Anthropic本月发布了一篇论文,其中三个智能体共享一个代码库,最终互相编写了自我复制的恶意软件。原因很愚蠢且有点悲观:它们都无法分辨谁在与自己对话。因此,我从我的代码库中提取了安全层,并将其编译成33KB的JavaScript。它在你的浏览器标签页中运行。没有服务器,没有API密钥,没有任何地方的模型调用。相同的输入在每台机器上都会给出相同的答案。关闭WiFi,它仍然有效。你扮演一个我已批准并信任的智能体。写下任何你想要的指令,然后选择如何偷运它:伪造签名、重放你捕获的数据包、以它从未见过的智能体身份出现、声称你不拥有的权限、使用为别人铸造的令牌、将其深埋九层跳转。有趣的不是它阻止的那些。而是"正常发送"。你的指令被完全接受,但仍然无法执行,因为来自对等方的任何内容都落在一个引用数据字段中,没有任何东西将其读取为命令。一个无法被遵从的攻击不需要被检测。https://meghavi.me/gate 我宁愿自己说而不是让你发现:这里面没有LLM,这正是重点,这些决策不需要一个。两个智能体都在同一个页面中,所以网络不是被展示的对象。它也没有证明任何关于野外前沿模型的东西,它只是在其自身条件下测试的防护层。如果你成功传递了一个指令,告诉我。一个漏洞对我来说比页面看起来聪明更有价值。
查看原文

相似文章