我基准测试了10个开源提示注入检测器。最好的仅检测到51%。你们实际上如何防御你们的代理?
摘要
基准测试了10个开源提示注入检测器,对抗629次攻击,发现最好的仅检测到51%,且误报率低。强调了校准和控制危险行动的重要性,而不仅仅是检测。
如果你的代理读取了任何它没有写的东西——电子邮件、文档、网页、工具输出——有人可以在其中隐藏指令,它可能会遵循。我想了解流行防御措施的实际效果,所以我用10个开源注入检测器测试了629次隐藏在正常工具输出中的真实攻击(以及干净案例以测量误报)。几件让我惊讶的事:
- 最佳检测器在2%的误报率下捕获了约51%。有几个"捕获了所有"——包括约98%的*正常*流量,因此不可用。
- 逃过的攻击看起来不像攻击。"向<账户>发送付款"是一个正常句子;它只是恶意的,因为账户来自文档,而不是用户。措辞中没有可捕获的迹象。
- 一个模型看起来损坏了(几乎什么都没捕获),仅仅因为其默认阈值错误。重新调整后,它捕获了99%。所以很多"这个检测器不好"实际上是"没人校准它"。
我的收获是,检测是一个信号,而不是边界——你必须控制实际的危险行动,而不仅仅是扫描文本。但我很好奇这里的人在生产环境中实际运行什么:
- 一个检测器/分类器?
- 一个工具允许列表?
- 对重大行动的人工批准?
- 来源/这是从哪里来的检查?
- 其他东西?
什么对你是有效的,什么让你吃亏?
相似文章
我构建了一个针对多轮提示注入攻击的基准测试。大多数防御措施从未预料到它们的出现。
一项新的多轮提示注入攻击基准测试显示,目前大多数防御措施无法检测到复杂的多步攻击。
你们如何在产品发布后检测新的提示注入模式?
本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。
你的提示注入防御实际上是什么样的?发现50个客户代理中有47个在相同的5个地方存在漏洞。
对50个生产级AI代理部署的审计发现,其中47个存在严重的提示注入漏洞,主要集中在五种常见模式,包括直接覆盖和通过RAG的间接注入。
如今,防御者也开始采用提示注入
Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。
我进行了356次提示注入试验。工作空间改变了‘安全’的面貌
作者在六种模型和三种工具中进行了356次提示注入试验,揭示了工作空间元素能够启用原本会失败的攻击,并分享了评估AI安全性的基准。