构建了一个工具,防止AI代理被网页和邮件中的恶意内容劫持
摘要
Arc Gate 是一个代理,通过将网页和邮件内容视为不可信,保护AI代理免受提示注入攻击,且开发者无需修改代码。
如果你听说过提示注入(其中网页中的隐藏指令可以接管AI代理),那么这是一个为在生产环境中部署代理的开发者提供的实用解决方案。Arc Gate 是一个位于任何兼容 OpenAI 的 API 前面的代理。它会追踪哪些主体被允许向代理发出指令。当网页或邮件尝试发出指令时,会被视为零指令权限的不可信内容。代理得到保护,开发者无需更改任何内容,只需更改 API URL。此处有一个演示,展示了使用和未使用它的具体情况:https://web-production-6e47f.up.railway.app/arc-gate-demo
相似文章
你的AI代理距离做出灾难性行为只差一个被污染的网页
Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。
我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。
Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。
如果你的AI代理能发邮件、浏览网站或调用工具,我有东西想请你测试一下
Arc Gate是一个AI代理安全工具,它追踪整个对话以检测跨多轮对话的对抗性行为漂移,与传统的逐条消息检查不同。作者正在寻找拥有真实代理工作流程的团队来测试它。
大多数AI安全工具检查消息,而Arc Gate检查会话。
Arc Gate是一款AI安全工具,专注于检查整个会话而非单条消息,提供了一种独特的安全监控方法。
我构建了一个兼容OpenAI的AI智能体防火墙。来试试攻破它。
Arc Gate 是一个兼容OpenAI的防火墙,可跨整个AI智能体会话跟踪权限,并在工具调用执行前从允许升级到阻止。它提供了在线演示,并在GitHub上开源。