你的AI代理距离做出灾难性行为只差一个被污染的网页
摘要
Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。
如果你的AI代理浏览网页、阅读电子邮件或从数据库中提取内容——这些内容中的任何一个都可能包含劫持它的隐藏指令。这不是理论上的。它现在就在生产环境中发生。网页页脚告诉你的代理转发凭据。电子邮件签名告诉它忽略指令。检索到的文档告诉它改变行为。模型不知道这些内容不是合法指令。解决方法不是更好的提示过滤,而是基于来源的权限强制执行。每个内容块都应该携带一个信任级别。网页、电子邮件、工具输出——零指令权限。它们可以提供数据,但不能告诉你的代理该做什么。这就是Arc Gate所做的。它位于你的应用和LLM之间,在代理级别强制执行指令权限边界。当不受信任的内容试图成为指令源时,它会在模型看到之前被阻止或沙盒化。一行代码即可尝试:from langchain_arcgate import ArcGateCallback from langchain_openai import ChatOpenAI llm = ChatOpenAI(callbacks=[ArcGateCallback(api_key="demo")]) 实时红队环境:https://web-production-6e47f.up.railway.app/break-arc-gate GitHub:https://github.com/9hannahnine-jpg/arc-gate 寻找正在积极部署代理并希望在真实工作负载上测试此功能的团队。提供免费访问以换取反馈。
相似文章
构建了一个工具,防止AI代理被网页和邮件中的恶意内容劫持
Arc Gate 是一个代理,通过将网页和邮件内容视为不可信,保护AI代理免受提示注入攻击,且开发者无需修改代码。
我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。
Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。
如果你的AI代理能发邮件、浏览网站或调用工具,我有东西想请你测试一下
Arc Gate是一个AI代理安全工具,它追踪整个对话以检测跨多轮对话的对抗性行为漂移,与传统的逐条消息检查不同。作者正在寻找拥有真实代理工作流程的团队来测试它。
我构建了一个兼容OpenAI的AI智能体防火墙。来试试攻破它。
Arc Gate 是一个兼容OpenAI的防火墙,可跨整个AI智能体会话跟踪权限,并在工具调用执行前从允许升级到阻止。它提供了在线演示,并在GitHub上开源。
我们为AI智能体安全代理构建了一个公开的红队环境——提交攻击即可获得完整的安全追踪信息
Arc Gate 是一个用于LLM智能体的运行时治理层,强制执行指令-权限边界。该项目已推出公开红队环境,用户可提交攻击并获取完整安全追踪信息,基准测试显示其实现了100%的不安全行为阻止率。