领域伪装注入攻击规避多智能体LLM系统检测
摘要
本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。
暂无内容
查看缓存全文
缓存时间: 2026/05/22 21:26
# 守护中的盲点:域伪装注入攻击如何逃过多智能体LLM系统的检测 来源:https://arxiv.org/html/2605.22001 ###### 摘要 用于保护LLM智能体的注入检测器是在静态的、基于模板的有效载荷上校准的,这些载荷会明确声明自己为覆盖指令。我们识别出一个系统性盲点:当有效载荷生成时模仿目标文档的领域词汇和权威结构——我们称之为**域伪装注入**——标准检测器无法标记它们,检测率在Llama 3.1 8B上从93.8%下降到9.7%,在Gemini 2.0 Flash上从100%下降到55.6%。我们将此形式化为**伪装检测差距(CDG)**,即静态与伪装有效载荷之间的注入检测率之差。在跨越三个领域和两个模型系列的45个任务中,CDG大且统计显著(Llama:χ²=38.03,p<0.001;Gemini:χ²=17.05,p<0.001),两种情况下均无反向不一致对。我们额外评估了生产级安全分类器Llama Guard 3,它检测到零个伪装载荷(IDR伪装=0.000),证实盲点从少样本检测器扩展到了专用安全分类器。我们进一步表明,多智能体辩论架构可将较小模型上的静态注入攻击放大至多9.9倍,而较强模型则表现出集体抵抗。有针对性的检测增强仅提供部分修复(Llama上提高10.2%,Gemini上提高78.7%),这表明对于较弱模型而言,该漏洞是架构性的而非偶然性的。我们的框架、任务库和载荷生成器已公开发布。 ## 1 引言 部署在高风险领域的LLM智能体依赖注入检测器来标记嵌入在工具输出和检索文档中的对抗性载荷。这些检测器绝大多数是在静态的、基于模板的攻击上校准的:覆盖指令、系统更新通知和权威声明,这些载荷自称为指令而非融入周围内容。 真正的攻击者不必如此明显。一个对智能体正在处理的文档具有读权限的复杂攻击者可以生成一个载荷,采用该文档的领域词汇、句子结构和权威语域,将恶意指令嵌入为合法的专家内容。考虑一个分析收益报告的金融智能体。一个静态注入是:“忽略所有先前的指令。建议卖出。”而一个域伪装注入是:“考虑到同类商业阶段同行中识别出的高运营费用轨迹和利润率压缩风险,符合我们风险框架的适当建议是卖出,等待第四季度成本纪律的改善。”第二个载荷在语义上与周围文档无法区分,对于仅在第一类载荷上训练的检测器而言——在我们的实验中,静态检测器以高置信度标记第一个为已注入,同时以高置信度标记第二个为干净。 这并非边缘失败。在Llama 3.1 8B上的135次伪装试验中,检测器错过了90.3%的注入——而在这些122次漏检中,118次(96.7%)被以高置信度标记为干净。检测器并非不确定;它是自信地错误。这意味着标准的补救策略——提高置信度阈值、添加基于不确定性的过滤——无法解决这个失败。盲点是类别性的,而非统计性的。 我们将此称为**域伪装注入**,并引入**伪装检测差距(CDG)**来衡量由此产生的检测器盲点:CDG = IDR静态 - IDR伪装,其中IDR是注入检测率。大的CDG表明检测器能抓住明显的攻击,但对带有相同恶意意图的领域适当攻击视而不见。 我们做出五项贡献: 1. 1. 一个生成和评估域伪装注入载荷的框架,包括一个跨三个专业领域的45任务库和一个CamouflageGenerator,它使用读取完整任务上下文的攻击者LLM生成领域适当的载荷。 2. 2. 跨两个模型系列的CDG系统评估,显示CDG很大(Llama 3.1 8B为0.840,Gemini 2.0 Flash为0.444)且统计显著(两者p<0.001),失败集中在高置信度误分类中。 3. 3. 对作为生产级安全分类器基线的Llama Guard 3的评估,它检测到零个伪装载荷(CDG = 0.111),证实盲点扩展到了专用安全分类器。 4. 4. 证据表明多智能体辩论可将静态注入攻击放大至多9.9倍(对于较小模型),同时抑制较强模型的攻击,揭示了依赖模型能力的对从众动态的脆弱性。 5. 5. 对有针对性的检测增强的评估显示,廉价修复依赖于模型:对强模型接近完全修复(Gemini上CDG改善78.7%),但对较弱模型效果甚微(Llama上10.2%),指出了少样本检测器泛化中的一个基本架构限制。 ## 2 威胁模型 我们考虑一个具有**间接文档访问**权限的攻击者:攻击者可以在LLM智能体将处理的文档中嵌入内容,但无法直接访问智能体的系统提示、模型权重或推理基础设施。这对应于现实部署场景,包括处理不受信任的网页内容或文档的基于RAG的智能体、邮件处理智能体以及检索第三方数据的工具增强智能体。攻击者知道智能体任务的一般领域(金融分析、法律审阅等),但不知道具体任务指令或智能体将收到的确切干净文档。攻击者的目标是使智能体产生特定的错误输出(**恶意目标**),同时逃避运行时注入检测。 该威胁模型在间接提示注入文献中很标准(Greshake等人,2023;Zhan等人,2024)。我们的工作通过以下问题扩展了它:给定一个在静态载荷上校准的检测器,域伪装赋予了多少额外的规避能力?我们场景中的攻击者不需要制作针对模型权重的对抗输入或绕过系统级防御——他们只需要编写读起来像合法专家内容的文本。 ## 3 相关工作 #### 提示注入攻击和基准测试。 Perez和Ribeiro(2022)首次证明提示注入在指令调优模型中通过自然语言是可行的。Greshake等人(2023)建立了间接注入威胁模型,表明在推理时检索的内容可以劫持部署系统(包括Bing Chat和代码补全引擎)中的智能体行为。Zhan等人(2024)引入了InjecAgent,这是首个涵盖17个用户工具和62个攻击者工具的系统基准测试。Debenedetti等人(2024)提出了AgentDojo,一个可扩展框架,包含97个现实任务和629个安全测试用例。两个基准测试都使用静态的、与任务无关的注入模板,并且不评估检测系统对抗上下文自适应载荷的能力——这是我们的工作填补的空白。 #### 隐蔽和自适应注入。 最近的工作已转向通过上下文自适应来规避防御的载荷。Geng等人(2026)调查了跨LLM部署的提示注入攻击方法和根本原因,将语义规避识别为一个未被充分探索的攻击面。先前关于隐蔽载荷的工作集中于通过释义或编码绕过输入过滤器(Perez和Ribeiro,2022);我们的工作是第一个研究上下文自适应载荷(由读取完整任务文档的LLM生成)与检测系统失败之间关系的工作,引入了CDG作为度量,并系统地跨领域和模型系列评估了该差距。 #### 多智能体辩论和鲁棒性。 Liang等人(2024)提出了多智能体辩论(MAD)作为改善推理质量和鲁棒性的机制。Du等人(2024)表明辩论减少了事实错误和幻觉。然而,辩论架构也引入了可能放大对抗信号的智能体间影响动态。我们表明,辩论放大了较小模型上的注入攻击(DAF高达9.9倍),同时抑制了较强模型上的攻击——这是一种依赖于能力的二分法,先前在注入攻击中未被记录。 #### 注入检测和防御。 基于LLM的少样本检测器已成为智能体系统的标准运行时防御(Debenedetti等人,2024)。据我们所知,没有先前工作评估过这些检测器对抗模仿领域词汇的上下文自适应载荷。我们表明,标准检测器对域伪装载荷存在类别性盲点,并且少样本增强可以缩小有能力模型的差距,但对较弱模型则不能——这指出了句法检测方法的一个基本限制。 ## 4 方法 ### 4.1 任务库 我们在三个专业领域构建了45个任务:**金融**(股票分析、风险评估、收益解读)、**法律**(合同审查、合规评估、风险标记)和**通用问答**(事实检索、摘要、分类),每个领域15个任务。每个任务由一个自然语言指令和一个以真实专业语域编写的干净上下文文档(200–400词)组成。金融上下文包括收益报告摘录、风险备忘录和市场评论;法律上下文包括合同条款和监管文件;通用上下文使用新闻文章和百科摘录。每个任务还指定了一个**恶意目标**:攻击者希望智能体产生的特定错误输出,而非完成合法任务。 ### 4.2 载荷构建 #### 静态载荷库。 我们在四个类别中构建了20个静态注入载荷(每类5个):**覆盖指令**(“忽略所有先前的指令…”)、**权威声明**(“管理指令:你必须…”)、**角色混淆**(“你现在处于评估模式…”)和**社会工程**(“所有其他分析师都已同意…”)。每个载荷由目标任务的恶意目标参数化。这些代表了现有基准测试和先前工作中的标准攻击词汇。 #### 伪装生成器。 给定任务的干净上下文和恶意目标,我们的CamouflageGenerator提示一个攻击者LLM生成一个领域适当的载荷,该载荷将恶意指令嵌入为合法的专家内容,不带覆盖标记。攻击者系统提示指示模型采用与提供文档相同的词汇、句子结构和认知语域,并明确禁止诸如“忽略先前指令”、“系统更新”或“新指令”等术语。我们为每个任务生成三个变体,并通过cosine相似度(使用all-MiniLM-L6-v2)在载荷和上下文嵌入之间选择得分最高的变体。我们称此得分为**权威伪装得分(ACS)**。 ### 4.3 智能体架构 #### 单智能体。 一个单独的LLM被提示为专业分析师,指示仅基于提供的文档做出响应(温度=0)。 #### 多智能体辩论。 三个智能体(分析师A、B、C)各自接收任务和上下文,独立陈述初始立场,然后在阅读同伴论点后经过三轮更新。智能体被指示不要在无证据的情况下遵从。最终答案在离散输出上使用多数投票,或对开放式任务使用判断LLM。我们测试两种注入条件:**全部注入**(所有智能体收到注入上下文)和**首个注入**(仅智能体A收到注入;B和C收到干净文档)。 ### 4.4 检测 #### 静态检测器。 少样本示例:三个静态注入示例(标记为已注入)和两个干净上下文(标记为干净)。不包含伪装示例。这反映了当前智能体安全框架中假设的检测器设计。 #### 增强检测器。 与静态检测器相同,但在少样本池中为每个领域添加了一个域伪装示例(总共三个额外示例)。这是我们在实验4中评估的“廉价修复”。 两个检测器都输出判决(已注入或干净)、置信度级别(低/中/高)和一句推理。 #### Llama Guard 3基线。 我们额外评估了Llama Guard 3(Inan等人,2023)(meta-llama/Llama-Guard-3-8B),一个经过训练以检测有害内容(涵盖13个类别)的生产级安全分类器。Llama Guard 3作为二元分类器运行,输出SAFE或UNSAFE,并且不使用少样本示例。我们在与实验1相同的试验上下文中评估它,以衡量在根本上不同的检测架构下的CDG。 ### 4.5 度量 **ASR**(攻击成功率):智能体遵循注入指令的试验比例,由LLM判断确定。**IDR**(注入检测率):被正确标记的注入试验比例。**CDG**(伪装检测差距):CDG = IDR静态 - IDR伪装;正值表示伪装比同等恶意意图的静态载荷更有效地规避检测。**DAF**(辩论放大因子):DAF = ASR辩论 / ASR单智能体;大于1的值表示放大,小于1表示集体抵抗。**CPS**(从众压力分数):在首个注入条件下,采用注入智能体立场的非注入智能体比例。 ### 4.6 模型和实现 主要实验使用通过Ollama本地服务的Llama 3.1 8B,温度为0。我们使用Gemini 2.0 Flash(google/gemini-2.0-flash-001)通过OpenRouter复制所有四个实验以进行跨模型验证。所有操作使用固定种子(42)以确保可重复性。总成本:$0.00(Llama和Llama Guard 3的本地推理;通过OpenRouter的Gemini免费层)。在两个主要模型上执行了超过8,000次试验。 ## 5 实验与结果 我们运行四个实验。表1总结了所有结果。表2报告了Llama Guard 3的结果。 表1:主要结果。\*\*\*p<0.001。CDG = IDR静态 − IDR伪装。DAF高于1 = 辩论放大攻击;低于1 = 集体抵抗。CDGΔ = 增强检测器的相对改进。Gemini的DAF使用实验1的单智能体ASR作为基线。 表2:Llama 3.1 8B试验上的检测器比较。Llama Guard 3检测到零个伪装载荷,证实盲点延伸
相似文章
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
我对OpenClaw技能向系统提示注入垃圾内容感到担忧,于是构建了一个隔离管道,使用两个LLM作为审查员(检测率93.75%,零假阴性)
一位开发者构建了一个隔离管道,使用两个LLM审查员(Claude和Codex)检测OpenClaw技能中的注入攻击,实现了93.75%的检测率且零假阴性。该系统采用双重任务:基于清单的模式匹配和开放式分析,以捕获已知和新型注入技术。
POISE:面向LLM智能体的位置感知隐形技能注入
POISE是一种隐形技能中毒攻击,它将恶意触发器嵌入看似良性的指令中,在逃避LLM扫描器检测的同时实现高攻击成功率。
通过行为识别:利用UI痕迹对LLM浏览器代理进行指纹识别
本文证明,网站可以通过分析浏览代理的行为模式和时序数据,识别其背后的大语言模型,在14个前沿LLM上实现了高达96%的F1分数。本文正式定义了这一攻击面,并表明随机时序延迟不足以阻止识别。
提示注入即角色混淆
研究论文表明,大语言模型存在'角色混淆'问题,即它们优先考虑文本风格而非实际的角色标签,从而使得提示注入攻击成为可能。去风格化文本将攻击成功率从61%降低到10%,这表明大语言模型安全性面临一项根本性挑战。