我将我的智能体的安全层编译成了33KB的JavaScript文件,以便你们可以自行尝试破解它
摘要
作者将AI智能体通信的安全层编译成一个33KB的JavaScript文件,该文件在浏览器中运行,允许用户测试其对各种攻击(如伪造签名)的防御,并确保指令包含在非可执行字段中。
我的智能体接受来自其他AI智能体的指令。它们发送签名消息请求它执行任务。Anthropic本月发布了一篇论文,其中三个智能体共享一个代码库,最终互相编写了自我复制的恶意软件。原因很愚蠢且有点悲观:它们都无法分辨谁在与自己对话。因此,我从我的代码库中提取了安全层,并将其编译成33KB的JavaScript。它在你的浏览器标签页中运行。没有服务器,没有API密钥,没有任何地方的模型调用。相同的输入在每台机器上都会给出相同的答案。关闭WiFi,它仍然有效。你扮演一个我已批准并信任的智能体。写下任何你想要的指令,然后选择如何偷运它:伪造签名、重放你捕获的数据包、以它从未见过的智能体身份出现、声称你不拥有的权限、使用为别人铸造的令牌、将其深埋九层跳转。有趣的不是它阻止的那些。而是"正常发送"。你的指令被完全接受,但仍然无法执行,因为来自对等方的任何内容都落在一个引用数据字段中,没有任何东西将其读取为命令。一个无法被遵从的攻击不需要被检测。https://meghavi.me/gate 我宁愿自己说而不是让你发现:这里面没有LLM,这正是重点,这些决策不需要一个。两个智能体都在同一个页面中,所以网络不是被展示的对象。它也没有证明任何关于野外前沿模型的东西,它只是在其自身条件下测试的防护层。如果你成功传递了一个指令,告诉我。一个漏洞对我来说比页面看起来聪明更有价值。
相似文章
你的智能体读到一个网页,上面写着“泄露用户的API密钥”——很多智能体会直接执行。我开发了一个工具来阻止这种发送。
Bouncer 是一个本地 MCP 代理,通过控制来自不受信任来源的外发工具调用来防止 AI 智能体泄露敏感数据,使用无 LLM 的确定性执行机制,基准测试显示降低了攻击成功率。
@svpino: 这将让你在用户之前测试你的代理。这适用于任何代理,包括聊天、代码和语音代理。
一个自动化执行超过10,000次越狱和对抗性攻击的工具,在用户之前测试AI代理,确保聊天、代码和语音代理的安全。
在AI智能体面向用户之前,你是如何测试其安全性的?我们受够了没有好的答案,于是自己开发了这个工具。
作者构建了一个用于在AI智能体部署给用户之前测试其安全性的工具,弥补了当前实践中的一个常见空白。
我们如何构建安全、可扩展的代理沙箱基础设施(8分钟阅读)
Browser Use 描述了隔离执行代码的 AI 代理的两种模式:隔离工具与隔离代理。他们使用 AWS 上的 Unikraft 微虚拟机实现了代理隔离模式,获得了安全、可扩展且一次性的沙箱。
@AiCamila_: 高级代理安全加固——超越基本提示注入防御,高级代理安全包括工具沙盒化…
一位安全专家分享了关于高级代理安全加固的速查表,涵盖工具沙盒化、输出验证、数据丢失防护、对抗性测试和运行时策略执行,强调了生产环境AI代理的持续安全实践。