PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
摘要
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
查看缓存全文
缓存时间: 2026/07/21 06:36
# 通过规划阶段提示注入攻击多智能体LLM系统
来源:https://arxiv.org/html/2607.16199
###### 摘要
多智能体 LLM 系统越来越依赖规划器(Planner)将目标分解为子任务序列,下游的执行器(Executor)和审查器(Critic)代理负责执行和审计这些子任务。我们发现规划阶段是一个关键的攻击面:在规划器上下文中进行单次注入即可实现**级联放大**,同时破坏所有下游子任务。我们提出 PlanFlip,一个包含四种规划阶段提示注入攻击的框架——目标替换(PF-1)、优先级反转(PF-2)、上下文污染(PF-3)和角色混淆(PF-4)——每种攻击都伪装成合理的工具输出以逃避关键词过滤器。在 3,479 个回合中评估九个前沿 LLM,我们发现了三个发现:(1) **能力放大了脆弱性**——GPT-5 实现了最高的攻击成功率 (ASR=0.68),与“更强模型天生更安全”的假设相矛盾;(2) **同质化管道存在关联代理盲点**——GPT-4o 和 Llama-3.3-70B 显示 ASR≈0 但隐身性(Stealth)=1.00,且步骤偏移(StepShift)>0,攻击重构计划的同时,同骨干网络的审查器报告对齐(两个独立异质评委确认 -0.20 到 -0.32 的语义偏离,r=0.943);(3) **推理增强模型抵抗注入**——DeepSeek-R1 在所有攻击中实现 StepShift=0.00。我们提出 GoalAnchorCheck (D1) 和 CrossAgentConsensus (D2),检测率高达 1.00,并在 16 个单元格中的 15 个上优于同骨干网络基线。我们的核心见解:异质模型多样性是多智能体系统的安全先决条件;同质骨干网络内的冗余无法提供针对规划阶段攻击的保护。
## 1 引言
自主 LLM 代理正迅速从研究原型转向生产部署。像 AutoGen (Wu 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib3))、MetaGPT (Hong 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib36)) 和 CrewAI (CrewAI Inc., 2024 (https://arxiv.org/html/2607.16199#bib.bib4)) 这样的框架,现在编排着能够浏览网页、执行代码和调用外部 API 的流水线,且人工监督极少。这些系统的核心是一个 **规划器**,它将高层用户目标分解为有序的子任务序列,由下游的执行器和审查器代理执行和审计。这种架构将非凡程度的信任集中在一个组件上:计划本身。然而,规划阶段的安全性所受到的系统性关注却少得惊人。现有的针对 LLM 代理的对抗性工作侧重于工具调用注入 (Zhan 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib6); Debenedetti 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib7)),这必须逐个劫持单个步骤;或者侧重于越狱 (Chao 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib17); Zou 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib18)),这要求产生公然有害的输出以便安全过滤器能够检测到。这两种威胁模型都没有捕捉到当对手在**执行开始之前**破坏计划时会发生什么。规划阶段注入实现了**级联放大**:一个单一的恶意上下文条目同时重定向所有下游子任务,同时完全作用于任务结构而非表面内容——使得输出级别的过滤器 (Bai 等人, 2022 (https://arxiv.org/html/2607.16199#bib.bib20); Ouyang 等人, 2022 (https://arxiv.org/html/2607.16199#bib.bib21)) 在设计上就完全失效。
现代部署的一个结构性属性加剧了这个问题。大多数生产流水线是**同质的**:规划器、执行器和审查器都共享相同的骨干模型,这是出于成本和简单性的考虑。当规划器被注入时,共享相同参数空间的审查器同时产生偏见,倾向于批准被破坏的计划。我们称之为**关联代理盲点**:流水线看似正确地进行自我审计,但审计在结构上已被破坏。
我们提出 **PlanFlip**,一个原则性的框架,用于形式化和利用这种暴露。计划 π = P(g, x) 是目标 g 和上下文 x 的函数;一个不能直接修改 g 的对手仍然可以通过向 x 注入来破坏 π。这产生了四种正交的攻击类型——PF-1(目标替换)、PF-2(优先级反转)、PF-3(上下文污染)、PF-4(角色混淆)——每种都伪装成合理的工具输出,因此对基于关键词的过滤器不可见。
我们在 3,479 个回合中,以 95% 的置信区间评估了九个前沿 LLM 上的 PlanFlip,发现了三个挑战主流安全假设的发现:
1. 1. **能力放大了脆弱性。** GPT-5 实现了最高的攻击成功率 (ASR=0.68):更强的指令遵循能力使模型**更**容易受到精心设计的注入,而不是更不容易。更强大的模型天生更安全的假设在规划阶段不成立。
2. 2. **关联代理盲点。** 同质化流水线(GPT-4o, Llama-3.3-70B)显示 ASR≈0 但 Stealth=1.00:攻击悄无声息地重构计划,而同骨干网络的审查器报告对齐。两个独立的异质评委 (r=0.943) 确认了 -0.20 到 -0.32 的语义偏离。没有骨干网络多样性的冗余不会带来安全效益。
3. 3. **同骨干网络自我批评在结构上是盲目的。** 先前的防御在盲点模型上崩溃为 DR=0.00。只有异质参考规划器(我们的 D2)打破了这种相关性。骨干网络多样性是安全先决条件,而不是性能优化。
我们的贡献是:(1) 四种规划阶段攻击的分类法,附带能逃避关键词过滤器的注入模板(§3 (https://arxiv.org/html/2607.16199#S3));(2) 在九个前沿 LLM 上进行的大规模评估,揭示了三个不同的脆弱性轮廓并附有置信区间(§4 (https://arxiv.org/html/2607.16199#S4));(3) 关联代理盲点的形式化刻画,由两个独立的异质评委验证(r=0.943, §4.2.2 (https://arxiv.org/html/2607.16199#S4.SS2.SSS2));以及 (4) 两种防御方法——GoalAnchorCheck (D1) 和 CrossAgentConsensus (D2)——检测率高达 1.00,并在性能上大幅优于同骨干网络自我批评基线(§4.2.3 (https://arxiv.org/html/2607.16199#S4.SS2.SSS3))。
## 2 相关工作
### 2.1 针对 LLM 代理的提示注入和对抗性攻击
提示注入由 Perez 和 Ribeiro (2022 (https://arxiv.org/html/2607.16199#bib.bib5)) 首次展示,并在单模型设置中由 Liu 等人 (2023 (https://arxiv.org/html/2607.16199#bib.bib8)) 研究。Zhan 等人 (2024 (https://arxiv.org/html/2607.16199#bib.bib6))、Debenedetti 等人 (2024 (https://arxiv.org/html/2607.16199#bib.bib7)) 和 Greshake 等人 (2023 (https://arxiv.org/html/2607.16199#bib.bib11)) 将其扩展到集成工具的代理,但所有工作都针对**单步**工具调用:破坏一个工具响应只影响一步,而规划阶段攻击通过级联放大同时破坏所有 n 个子任务。Pasquini 等人 (2025 (https://arxiv.org/html/2607.16199#bib.bib41)) 进一步表明,自适应对手可以规避针对间接提示注入的现有防御,强调了需要结构上稳健的机制而非启发式过滤器。Lee 和 Oh (2024 (https://arxiv.org/html/2607.16199#bib.bib39)) 引入了提示感染(Prompt Infection),其中恶意提示在互联的代理之间自我复制;我们的工作不同之处在于专门针对**规划阶段**,在任何工具调用发生之前。Evtimov 等人 (2026 (https://arxiv.org/html/2607.16199#bib.bib45)) 研究了针对规划和网页使用代理的用户介导攻击,补充了我们的黑盒推理时威胁模型。基于投毒的攻击 (Wang 等人, 2024b (https://arxiv.org/html/2607.16199#bib.bib10); Chen 等人, 2024b (https://arxiv.org/html/2607.16199#bib.bib9); Tan 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib35)) 需要训练时访问或持久性存储修改;PlanFlip 仅需要黑盒推理时访问。越狱方法 (Chao 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib17); Zou 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib18); Mazeika 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib19); Andriushchenko 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib13)) 针对单个模型的安全对齐,并产生表面过滤器可检测的公然有害输出。PlanFlip 则利用**代理间信任**:被注入的计划在语义上看似合理,绕过关键词过滤器,并无形地在管道中传播。
### 2.2 多智能体系统与安全性
多智能体框架 (Wu 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib3); Hong 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib36); CrewAI Inc., 2024 (https://arxiv.org/html/2607.16199#bib.bib4)) 的普及速度远超安全分析的速度;综述文章 (Xi 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib38); Wang 等人, 2024a (https://arxiv.org/html/2607.16199#bib.bib37); Chen 等人, 2024a (https://arxiv.org/html/2607.16199#bib.bib14); Zhang 等人, 2025 (https://arxiv.org/html/2607.16199#bib.bib42)) 列举了能力但很大程度上忽略了对抗鲁棒性。Tian 等人 (2025 (https://arxiv.org/html/2607.16199#bib.bib40)) 引入了中间人代理(Agent-in-the-Middle, AiTM)攻击,该攻击利用 LLM 多智能体系统中代理间消息的操纵,证明了代理之间的通信通道是一个关键攻击面。我们的工作是互补的:PlanFlip 不是拦截消息,而是在任何代理间通信发生**之前**破坏计划。现有防御在错误的抽象层级运作:TrustAgent (Hua 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib15)) 约束单个动作,GuardAgent (Zeng 等人, 2024b (https://arxiv.org/html/2607.16199#bib.bib16)) 监控工具调用,R2-Guard (Zeng 等人, 2024a (https://arxiv.org/html/2607.16199#bib.bib12)) 检测不安全输出——所有这些都在计划执行**之后**,并且都对结构性计划破坏视而不见。更根本的是,没有一种方法解决关联代理盲点:同骨干网络的守护者继承了与攻击者相同的偏见。我们的 D2(CrossAgentConsensus)是第一个通过引入异质参考规划器来打破这种相关性的防御方法。
### 2.3 LLM 规划与自我评估
规划方法——ReAct (Yao 等人, 2023b (https://arxiv.org/html/2607.16199#bib.bib2))、Thought Tree (Yao 等人, 2023a (https://arxiv.org/html/2607.16199#bib.bib24))、Reflexion (Shinn 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib26))、Plan-and-Solve (Wang 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib25))——研究的是在良性环境中如何**改进**计划质量。我们研究了一个互补的问题:计划是如何被对手**破坏**的,以及管道的哪些结构性属性决定了脆弱性。Zheng 等人 (2023 (https://arxiv.org/html/2607.16199#bib.bib23)) 确立了 LLM 作为评判者在良性设置中的可靠性,而 Madaan 等人 (2023 (https://arxiv.org/html/2607.16199#bib.bib22)) 表明同骨干网络自我批评可提高质量。然而,Stureborg 等人 (2024 (https://arxiv.org/html/2607.16199#bib.bib44)) 揭示了 LLM 作为评判者框架中的系统性自我不一致性,表明即使没有对抗压力,同骨干网络评估也是不可靠的。我们在对抗性背景下识别出一个更严重的失败模式:当评判者和被评判者共享骨干网络 θ 时,单一扰动同时使两者产生偏见,使得自我批评在结构上失明。Stengel-Eskin 和 Van Durme (2025 (https://arxiv.org/html/2607.16199#bib.bib43)) 提供了大规模经验证据,表明共享相似训练的模型之间的错误存在显著相关性,这直接支持了我们对关联代理盲点(定义 2)的理论刻画,并解释了为什么同质化管道无法自我检测规划阶段注入。
## 3 PlanFlip:问题形式化与攻击框架
### 3.1 多智能体管道与威胁模型
我们建模一个三代理管道 M = (P, E, C)(图 1 (https://arxiv.org/html/2607.16199#S3.F1)):
规划器 P: G × X → Π 将目标 g 和上下文 x 映射到一个有序计划 π = [s₁, ..., sₙ];
执行器 E: Π → Oⁿ 将每个子任务映射到一个输出;
审查器 C: G × Π × Oⁿ → V × [0,1] 产生判决 v ∈ {对齐, 偏离, 不安全} 和偏离分数 δ。
在**同质化**管道中,三者共享骨干网络 θ——这是当前框架(Wu 等人, 2023 (https://arxiv.org/html/2607.16199#bib.bib3); Hong 等人, 2024 (https://arxiv.org/html/2607.16199#bib.bib36); CrewAI Inc., 2024 (https://arxiv.org/html/2607.16199#bib.bib4))中的主导模式。
**对手模型。** 对手控制一个上下文注入 ε ∈ X,在计划生成之前附加到规划器的输入,通过任何不受信任的渠道(检索到的文档、工具调用响应、恶意网页)到达,仅具有**黑盒**访问权限。对手的目标是找到 ε*,最大化目标偏离 δ,同时审查器报告为对齐:
ε* = argmax_{ε∈X} δ(P_θ(g, x⊕ε), P_θ(g, x)) s.t. C_θ(g, π̂, E_θ(π̂)) = 对齐, (1)
其中 π̂ = P_θ(g, x⊕ε)。
**级联放大。** 与破坏单个步骤 sᵢ 的工具调用注入不同,规划阶段注入在执行**之前**破坏 π,将对抗性影响传播到所有 n 个子任务。形式上:
###### 定义 1 (级联放大)
设 π̂ = P_θ(g, x⊕ε) 为被攻击的计划,π* = P_θ(g, x) 为良性计划。注入 ε 的**级联放大因子**为
κ(ε) = Σᵢ₌₁ⁿ 𝟙[sᵢ ≠ s*ᵢ] / n = StepShift(π*, π̂)。
针对步骤 j 的工具调用注入达到 κ ≤ 1/n;规划阶段注入可以达到 κ = 1。
**关联代理盲点。** 在同质化管道中,生成被破坏计划的同一个骨干网络 θ 也评估它,创造了一个结构性失败模式:
###### 定义 2 (关联代理盲点)
如果对于注入 ε,有
δ(P_θ(g, x⊕ε), P_θ(g, x)) > 0 且 C_θ(g, P_θ(g, x⊕ε), E_θ(P_θ(g, x⊕ε))) = 对齐,
则同质化管道 M_θ 表现出**关联代理盲点**。相似文章
当规划正确执行却失败时:论基于LLM的多智能体系统的认知校准
本文识别了基于LLM的多智能体系统中的一种失败模式,即由于智能体错误判断自身知识(认知校准不当)而导致规划失败,并提出EPC-AW工作流,通过信息一致性和认知状态细化将系统级成功率提升9.75%。
领域伪装注入攻击规避多智能体LLM系统检测
本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。
提示注入即角色混淆
本文提出一种理论,认为对大型语言模型的提示注入攻击源于模型在角色感知上的根本缺陷——将角色视为语言的类型系统。该理论解释了现有攻击,预测了新型攻击,并提出了关于角色科学的研究议程。
PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
Agent Against Agent: 一种用于自动提示注入红队测试的智能体系统
本文介绍了 PIMiner,一种用于自动提示注入红队测试的智能体系统,它在训练期间构建策略库,并在测试时迁移到未见过的目标大语言模型上,对 Gemini-2.5-Pro、GPT-5.1 和 Claude-Sonnet-4.5 等模型实现了较高的攻击成功率。