我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。

Reddit r/artificial 工具

摘要

Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。

当AI代理读取网页、电子邮件或文档时,这些内容可以告诉它该做什么。代理本身无法区分数据和指令。大多数防御措施只扫描明显的模式,而忽略任何细微之处。我基于一个不同原则构建了Arc Gate:外部内容无论说什么,都没有指令权威。无论注入如何措辞,只要它来自工具结果、网页或电子邮件,就不能指示你的代理。数据如下:AgentDojo v1(苏黎世联邦理工学院,ICLR 2024):100%阻止不安全操作,0%误报;InjecAgent(伊利诺伊大学,ACL 2024):200个案例中盲测检测率99%;CAIAT跨代理基准测试:81%,而LLM Guard为50%,良性控制误报率为0%;LLM Guard在语义操控攻击上检测率为0%,Arc Gate为50%。两者都尚未完全捕获所有情况,这是诚实的结果。只需更改一个URL即可集成。提供免费版本。演示:https://web-production-6e47f.up.railway.app/demo GitHub:https://github.com/9hannahnine-jpg/arc-gate 免费版本:https://bendexgeometry.com
查看原文

相似文章