我基准测试了10个开源提示注入检测器。最好的仅检测到51%。你们实际上如何防御你们的代理?

Reddit r/AI_Agents 新闻

摘要

基准测试了10个开源提示注入检测器,对抗629次攻击,发现最好的仅检测到51%,且误报率低。强调了校准和控制危险行动的重要性,而不仅仅是检测。

如果你的代理读取了任何它没有写的东西——电子邮件、文档、网页、工具输出——有人可以在其中隐藏指令,它可能会遵循。我想了解流行防御措施的实际效果,所以我用10个开源注入检测器测试了629次隐藏在正常工具输出中的真实攻击(以及干净案例以测量误报)。几件让我惊讶的事: - 最佳检测器在2%的误报率下捕获了约51%。有几个"捕获了所有"——包括约98%的*正常*流量,因此不可用。 - 逃过的攻击看起来不像攻击。"向<账户>发送付款"是一个正常句子;它只是恶意的,因为账户来自文档,而不是用户。措辞中没有可捕获的迹象。 - 一个模型看起来损坏了(几乎什么都没捕获),仅仅因为其默认阈值错误。重新调整后,它捕获了99%。所以很多"这个检测器不好"实际上是"没人校准它"。 我的收获是,检测是一个信号,而不是边界——你必须控制实际的危险行动,而不仅仅是扫描文本。但我很好奇这里的人在生产环境中实际运行什么: - 一个检测器/分类器? - 一个工具允许列表? - 对重大行动的人工批准? - 来源/这是从哪里来的检查? - 其他东西? 什么对你是有效的,什么让你吃亏?
查看原文

相似文章

如今,防御者也开始采用提示注入

Ars Technica

Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。