我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。
摘要
Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。
当AI代理读取网页、电子邮件或文档时,这些内容可以告诉它该做什么。代理本身无法区分数据和指令。大多数防御措施只扫描明显的模式,而忽略任何细微之处。我基于一个不同原则构建了Arc Gate:外部内容无论说什么,都没有指令权威。无论注入如何措辞,只要它来自工具结果、网页或电子邮件,就不能指示你的代理。数据如下:AgentDojo v1(苏黎世联邦理工学院,ICLR 2024):100%阻止不安全操作,0%误报;InjecAgent(伊利诺伊大学,ACL 2024):200个案例中盲测检测率99%;CAIAT跨代理基准测试:81%,而LLM Guard为50%,良性控制误报率为0%;LLM Guard在语义操控攻击上检测率为0%,Arc Gate为50%。两者都尚未完全捕获所有情况,这是诚实的结果。只需更改一个URL即可集成。提供免费版本。演示:https://web-production-6e47f.up.railway.app/demo GitHub:https://github.com/9hannahnine-jpg/arc-gate 免费版本:https://bendexgeometry.com
相似文章
构建了一个工具,防止AI代理被网页和邮件中的恶意内容劫持
Arc Gate 是一个代理,通过将网页和邮件内容视为不可信,保护AI代理免受提示注入攻击,且开发者无需修改代码。
你的AI代理距离做出灾难性行为只差一个被污染的网页
Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。
我们为AI智能体安全代理构建了一个公开的红队环境——提交攻击即可获得完整的安全追踪信息
Arc Gate 是一个用于LLM智能体的运行时治理层,强制执行指令-权限边界。该项目已推出公开红队环境,用户可提交攻击并获取完整安全追踪信息,基准测试显示其实现了100%的不安全行为阻止率。
我构建了一个兼容OpenAI的AI智能体防火墙。来试试攻破它。
Arc Gate 是一个兼容OpenAI的防火墙,可跨整个AI智能体会话跟踪权限,并在工具调用执行前从允许升级到阻止。它提供了在线演示,并在GitHub上开源。
AI代理只需一次提示注入,就可能做出你绝不会要求它们做的事。我们构建了一个修复方案。
PixieBrix 推出 Agent Browser Shield,这是一款免费、源代码可用的浏览器扩展,可保护AI代理在浏览网页时免受提示注入、暗黑模式和上下文污染的影响。