SCOUT先行:提示注入防御中自适应检测器分配的预推理
摘要
介绍SCOUT,一个通过预测可靠性和延迟来动态分配每个请求的提示注入检测器的框架,提高了安全性和效率。同时提出SCOUT-450,一个针对复杂面向代理的注入的基准测试,与固定的GPT-4o判断器相比,攻击成功率降低46%,延迟降低40%。
查看缓存全文
缓存时间: 2026/06/10 00:08
论文页面 - 先派出SCOUT:提示注入防御中自适应检测器分配的预推理
来源:https://huggingface.co/papers/2605.30837
摘要
SCOUT框架通过预测检测器的可靠性和延迟,动态分配提示注入检测,相比固定的单一检测器方法,提升了安全性和效率。
提示注入检测器(https://huggingface.co/papers?q=Prompt-injection%20detectors)具有异构性:每个检测器在不同攻击类型上表现各异,没有哪个检测器始终可靠。然而,现有系统仍将检测视为固定的单一检测器管道,将所有请求交由同一检测器的盲区处理。我们重新将防御定义为检测器分配(https://huggingface.co/papers?q=detector%20allocation):面对异构检测器池,针对每个请求决定运行哪些检测器,以及是否升级到LLM评审。我们的框架SCOUT(https://huggingface.co/papers?q=SCOUT)(可扩展与可控的面向不确定性分诊的结果预测(https://huggingface.co/papers?q=Uncertainty-aware%20Triage))通过预测每个检测器在相似历史输入上的逐样本可靠性和延迟,实现了动态决策,并向操作员暴露一个单一的安全-效用阈值(https://huggingface.co/papers?q=safety-utility%20threshold)(其中效用综合了良性通过率(https://huggingface.co/papers?q=benign-pass%20rate)和实际耗时(https://huggingface.co/papers?q=wall-clock))。为评估这一设定,我们构建了SCOUT-450(https://huggingface.co/papers?q=SCOUT-450)基准,该基准包含了结构复杂、面向智能体的注入,这些注入在旧版提示注入集中代表性不足。在SCOUT-450(https://huggingface.co/papers?q=SCOUT-450)上,一个面向安全的工作点将攻击成功率(https://huggingface.co/papers?q=attack-success%20rate)降低了46%,总实际耗时(https://huggingface.co/papers?q=wall-clock)相比始终开启的GPT-4o评审(https://huggingface.co/papers?q=GPT-4o%20judge)降低了40%,而良性效用仅下降5.1分。SCOUT(https://huggingface.co/papers?q=SCOUT)同样适用于三个外部基准(BIPIA(https://huggingface.co/papers?q=BIPIA)、IPI(https://huggingface.co/papers?q=IPI)和IHEval(https://huggingface.co/papers?q=IHEval)),改进了安全-效用前沿。
查看arXiv页面(https://arxiv.org/abs/2605.30837)查看PDF(https://arxiv.org/pdf/2605.30837)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30837)
在您的智能体中获取该论文:
hf papers read 2605.30837
没有最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
无模型链接该论文
请在一个模型README.md中引用arxiv.org/abs/2605.30837以从该页面链接。
引用该论文的数据集0
无数据集链接该论文
请在一个数据集README.md中引用arxiv.org/abs/2605.30837以从该页面链接。
引用该论文的Space0
无Space链接该论文
请在一个Space README.md中引用arxiv.org/abs/2605.30837以从该页面链接。
包含该论文的收藏1
相似文章
如今,防御者也开始采用提示注入
Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。
你们如何在产品发布后检测新的提示注入模式?
本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。
理解提示词注入:AI安全的前沿挑战
OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。
你的提示注入防御实际上是什么样的?发现50个客户代理中有47个在相同的5个地方存在漏洞。
对50个生产级AI代理部署的审计发现,其中47个存在严重的提示注入漏洞,主要集中在五种常见模式,包括直接覆盖和通过RAG的间接注入。
提示注入仍在破坏代理系统——我构建了一个在运行时强制指令/数据分离的网关
一个在运行时强制指令/数据分离以保护代理系统免受提示注入攻击的网关