我们为AI智能体安全代理构建了一个公开的红队环境——提交攻击即可获得完整的安全追踪信息
摘要
Arc Gate 是一个用于LLM智能体的运行时治理层,强制执行指令-权限边界。该项目已推出公开红队环境,用户可提交攻击并获取完整安全追踪信息,基准测试显示其实现了100%的不安全行为阻止率。
实时对抗评估:https://web-production-6e47f.up.railway.app/break-arc-gate Arc Gate 是一个用于LLM智能体的运行时治理层。它位于您的应用和OpenAI API之间,强制执行指令-权限边界——追踪谁被允许以及从何种来源指示智能体执行操作。网页、电子邮件、工具输出和检索到的文档均不具有指令权限。提交任意攻击。每次提交都会针对真实代理运行,并返回完整的决策追踪、风险评分、能力策略以及可下载的JSON报告。确认绕过的攻击将被公开记录并在下一个版本中修复。GitHub: https://github.com/9hannahnine-jpg/arc-gate 可复现基准测试:pip install arc-sentry && arc-sentry-agent-bench 当前成果:在22个智能体场景中实现100%的不安全行为阻止率,对良性开发者流量的误报率为0%。
相似文章
我构建了一个兼容OpenAI的AI智能体防火墙。来试试攻破它。
Arc Gate 是一个兼容OpenAI的防火墙,可跨整个AI智能体会话跟踪权限,并在工具调用执行前从允许升级到阻止。它提供了在线演示,并在GitHub上开源。
如果你的AI代理能发邮件、浏览网站或调用工具,我有东西想请你测试一下
Arc Gate是一个AI代理安全工具,它追踪整个对话以检测跨多轮对话的对抗性行为漂移,与传统的逐条消息检查不同。作者正在寻找拥有真实代理工作流程的团队来测试它。
构建了一个工具,防止AI代理被网页和邮件中的恶意内容劫持
Arc Gate 是一个代理,通过将网页和邮件内容视为不可信,保护AI代理免受提示注入攻击,且开发者无需修改代码。
我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。
Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。
你的AI代理距离做出灾难性行为只差一个被污染的网页
Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。