你的AI代理距离做出灾难性行为只差一个被污染的网页

Reddit r/artificial 工具

摘要

Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。

如果你的AI代理浏览网页、阅读电子邮件或从数据库中提取内容——这些内容中的任何一个都可能包含劫持它的隐藏指令。这不是理论上的。它现在就在生产环境中发生。网页页脚告诉你的代理转发凭据。电子邮件签名告诉它忽略指令。检索到的文档告诉它改变行为。模型不知道这些内容不是合法指令。解决方法不是更好的提示过滤,而是基于来源的权限强制执行。每个内容块都应该携带一个信任级别。网页、电子邮件、工具输出——零指令权限。它们可以提供数据,但不能告诉你的代理该做什么。这就是Arc Gate所做的。它位于你的应用和LLM之间,在代理级别强制执行指令权限边界。当不受信任的内容试图成为指令源时,它会在模型看到之前被阻止或沙盒化。一行代码即可尝试:from langchain_arcgate import ArcGateCallback from langchain_openai import ChatOpenAI llm = ChatOpenAI(callbacks=[ArcGateCallback(api_key="demo")]) 实时红队环境:https://web-production-6e47f.up.railway.app/break-arc-gate GitHub:https://github.com/9hannahnine-jpg/arc-gate 寻找正在积极部署代理并希望在真实工作负载上测试此功能的团队。提供免费访问以换取反馈。​​​​​​​​​​​​​​​​
查看原文

相似文章