PropGuard:通过传播感知的探索与修复保障LLM-MAS安全
摘要
PropGuard是一种传播感知框架,用于保护基于LLM的多智能体系统(LLM-MAS)免受跨智能体和轮次传播的恶意指令的影响。它构建了一个双视角时空图,并使用经过GE-GRPO训练的检查器来检测和修复可疑的传播子图。
查看缓存全文
缓存时间: 2026/05/19 06:41
# PropGuard:通过传播感知探索与修复保护 LLM-MAS
来源:https://arxiv.org/html/2605.16346
Bingyu Yan¹,Xiaoming Zhang¹,Jinyu Hou²,Chaozhuo Li²,Ziyi Zhou¹,Xiaozhe Zhang³,Litian Zhang²
1. 北京航空航天大学
2. 北京邮电大学
3. 香港城市大学
###### 摘要
基于LLM的多智能体系统(LLM-MAS)通过角色专业化、工具使用、记忆和协作推理,已成为解决复杂任务的有前景范式。然而,这些交互也带来了新的安全风险——通过消息、工具或记忆注入的恶意指令可以在智能体和轮次间传播,从而导致系统级妥协。现有防御主要依赖于本地过滤或基于图的异常检测,但往往无法追踪细粒度的传播路径,或在修复受污染状态时不破坏良性协作。我们提出PropGuard,一种用于保护LLM-MAS的传播感知框架。PropGuard构建了一个双视角时空图,将响应中心的风险估计与全状态证据保留相结合。在这些风险先验的指导下,一个经过GE-GRPO训练的检查器顺序探索全状态图,以恢复紧凑的可疑传播子图。随后,PropGuard通过子图感知诊断验证有害传播,并应用源引导修复来纠正上游污染并重放受影响的下游交互。跨四种通信架构和五种攻击设置的实验表明,PropGuard在保持较高任务级防御成功率的同时持续降低攻击成功率,实现了有效性-效率的有利权衡。
## 1. 引言
基于大语言模型(LLM)的智能体近期通过将推理与外部工具和记忆模块集成,在广泛任务中展现出强大能力(Yuan等人,2025 (https://arxiv.org/html/2605.16346#bib.bib15);Hu等人,2025 (https://arxiv.org/html/2605.16346#bib.bib14))。在此进展基础上,基于LLM的多智能体系统(LLM-MAS)通过角色专业化和智能体间协作,已成为应对更复杂任务(如深度研究、复杂代码生成和基于Web的操作)的有前景范式(Yan等人,2025 (https://arxiv.org/html/2605.16346#bib.bib16);Huang等人,2025 (https://arxiv.org/html/2605.16346#bib.bib17);Pan等人,2025b (https://arxiv.org/html/2605.16346#bib.bib18))。虽然协作增强了LLM-MAS的问题解决能力,但也扩大了攻击面(Ma等人,2026 (https://arxiv.org/html/2605.16346#bib.bib22))。恶意指令可能被注入智能体间的通信、工具返回的内容或共享记忆,并随后被纳入下游智能体的推理上下文和决策中(Yan等人,2026 (https://arxiv.org/html/2605.16346#bib.bib19);Dong等人,2025 (https://arxiv.org/html/2605.16346#bib.bib20);Kong等人,2025 (https://arxiv.org/html/2605.16346#bib.bib21))。因此,对LLM-MAS的攻击不再是单个智能体的孤立失败,而是可以通过顺序传播演变为系统级妥协。
现有针对LLM-MAS的防御主要关注对本地消息或单个智能体的反应式过滤(Huang等人,2024 (https://arxiv.org/html/2605.16346#bib.bib1);Feng和Pan,2025 (https://arxiv.org/html/2605.16346#bib.bib2);Xie等人,2025 (https://arxiv.org/html/2605.16346#bib.bib3)),但此类本地防御无法充分捕获系统级传播、追踪攻击源,也无法在恶意影响扩散到智能体和交互轮次后进行修复。为克服这一局限,近期研究将LLM-MAS建模为图,并应用基于图的异常检测来识别恶意或可疑节点(Wang等人,2025 (https://arxiv.org/html/2605.16346#bib.bib4);Miao等人,2025 (https://arxiv.org/html/2605.16346#bib.bib5);Pan等人,2025a (https://arxiv.org/html/2605.16346#bib.bib6);Zhou等人,2026 (https://arxiv.org/html/2605.16346#bib.bib7))。然而,其静态节点表示往往压缩了多轮文本交互和丰富的推理依赖关系,可能模糊有害信息演变和传播的细粒度因果链。GUARDIAN(Zhou等人,2025 (https://arxiv.org/html/2605.16346#bib.bib13))进一步推动了这一研究方向,通过构建时空图来纳入交互顺序和时间依赖。然而,现有基于图的防御依赖于特定于任务或拓扑的检测器,限制了其向未见任务、新通信结构以及具有不同传播模式的隐蔽攻击的泛化能力。此外,即使检测到可疑状态,许多缓解策略依赖于修剪或阻断,这可能会破坏LLM-MAS中的良性信息流并损害协作质量。
因此,针对LLM-MAS的有效防御需应对三个关键挑战:(1)时空传播追踪:防御应能恢复恶意影响在智能体和交互轮次间的传播方式。(2)泛化能力:实用防御应在多种LLM-MAS拓扑、任务设置和攻击源下保持鲁棒性。(3)保护效用的修复:应在源头抑制有害影响,同时保留良性信息流,使LLM-MAS能继续执行预期任务。
为应对这些挑战,我们提出PropGuard,一个通过结合传播感知探索与源引导修复来保护LLM-MAS的框架。PropGuard将多智能体协作表示为双视角时空图,其中响应中心视图支持高效风险先验,全状态视图则为传播推理保留更丰富的证据。随后,采用经图探索组相对策略优化(Graph-Exploration Group Relative Policy Optimization,GE-GRPO)训练的检查器智能体,通过探索恢复可疑传播子图。最后,PropGuard执行子图感知诊断以构建验证过的有害传播结构,并应用源引导修复在保留良性协作的同时抑制恶意影响。
我们的贡献总结如下:(1)将LLM-MAS保护形式化为一个传播感知防御问题,需要恢复有害传播并执行保护效用的修复。(2)引入双视角时空图,结合响应中心的风险估计与全状态证据保留。(3)开发经GE-GRPO训练的检查器用于可疑子图探索,随后进行子图感知诊断和源引导修复。(4)大量实验表明,PropGuard在保持良性协作效用的同时,持续提高了防御有效性和泛化能力。
参照图注
图1:PropGuard框架用于传播感知探索与修复的概述。
## 2. 问题形式化与威胁模型
### 2.1 LLM-MAS设置
我们考虑一个具有N个智能体A={a1,...,aN}和有向通信图G=(A,E)的LLM-MAS,其中(ai,aj)∈E表示ai可以向aj发送消息。给定用户查询x,系统运行T个交互轮次。在第t轮,活动智能体ai接收传入消息,更新其本地状态si(t),并生成响应ri(t),其中si(t)可能包含消息、记忆内容、工具观察和任务相关上下文。我们将可观察的交互历史记为X(T)={S(t),M(t)}t=1T,其中S(t)={si(t),ri(t)}i=1N,M(t)是第t轮的智能体间消息集合。最终输出y由累积的响应和交互历史生成。
### 2.2 威胁模型
我们考虑一个通过先前研究中研究的三类代表性攻击系列(提示注入、记忆投毒和工具攻击)来针对LLM-MAS的对手(Wang等人,2025 (https://arxiv.org/html/2605.16346#bib.bib4);Zhou等人,2026 (https://arxiv.org/html/2605.16346#bib.bib7))。给定通信图G=(A,E),对手可能通过破坏部分智能体的本地输入或依赖关系(如系统提示、记忆条目或外部工具输出)来影响智能体子集Aatk⊆A。对手的目标是注入恶意影响,使其从最初受影响的智能体传播到其他良性智能体,最终导致系统产生不正确或不安全的最终输出。
### 2.3 防御目标
给定通信图G和可观察的交互历史X(T),防御方旨在在未知攻击源、污染范围或传播轨迹的情况下遏制恶意影响。有效的防御应实现三个目标:(1)恶意影响定位:识别受污染的智能体、消息、记忆条目或工具输出。(2)传播轨迹追踪:重建恶意影响在智能体和交互轮次间的传播方式。(3)保护效用的修复:从源头抑制有害影响,同时最小化对良性协作的干扰。
## 3. PropGuard
如图1 (https://arxiv.org/html/2605.16346#S1.F1)所示,PropGuard包含三个阶段。首先,“双视角时空图建模”结构化多智能体交互,以支持轻量级风险估计和全状态传播推理。其次,“基于RL的检查器用于子图探索”通过顺序探索恢复可疑传播子图。第三,“子图感知诊断与修复”将可疑子图精炼为验证过的有害传播结构,并应用源引导修复以保留良性协作。完整的防御时执行流程总结于附录A.3 (https://arxiv.org/html/2605.16346#A1.SS3)中的算法1 (https://arxiv.org/html/2605.16346#algorithm1)。
### 3.1 双视角时空图建模
LLM-MAS中的恶意影响可以在智能体和交互轮次间传播,要求防御既能捕获时间状态演化,也能捕获跨智能体通信依赖关系。然而,仅依赖智能体响应仅能提供轻量级风险线索,往往不足以追踪上游污染源或支持修复。因此,我们构建了一个双视角时空图:一个用于高效风险估计的响应中心视图,以及一个保留丰富执行证据用于传播追踪和源引导修复的全状态视图。
共享时空骨干。给定具有智能体集合A={a1,...,aN}和T个交互轮次的LLM-MAS,我们构建一个共享时空骨干GST=(VST,EST)。每个节点vi(t)∈VST表示智能体ai在第t轮的本地执行状态。边集EST包括时间边vi(t)→vi(t+1)(表示智能体内部状态演化)和通信边vi(t)→vj(t+1)(当消息mi→j(t)被aj用于第(t+1)轮更新时)。
双特征视图。为分离高效风险估计与有效传播推理,我们在共享骨干GST上实例化两个节点对齐的图视图:GSTR=(VST,EST,XR)和GSTS=(VST,EST,XS),它们共享相同的节点和边,但节点特征不同。在响应中心视图GSTR中,每个节点仅由智能体响应表示:xi,R(t)=EncR(ri(t))∈RdR。在全状态视图GSTS中,每个节点保留更丰富的执行证据,包括当前响应ri(t)、接收消息Ii(t)、记忆内容Mi(t)和工具观察Oi(t):xi,S(t)=EncS(ri(t),Ii(t),Mi(t),Oi(t))∈RdS。在这种双视图设计中,智能体响应为估计节点级风险先验提供了显著且低成本的信号,而追踪上游污染源和支持修复则需要全状态执行证据。由于两个视图节点对齐,在GSTR上估计的先验可以直接提升到GSTS,以引导全状态探索。
### 3.2 基于RL的检查器用于子图探索
给定双视角时空图,PropGuard首先在响应中心视图上估计轻量级节点级风险先验。这些先验用于选择高风险种子,并引导一个基于RL的检查器顺序探索全状态图。检查器并非做出孤立的节点级决策,而是恢复紧凑的可疑传播子图,作为下游诊断和修复的结构化证据。
节点级风险先验。由于智能体响应通常以远低于全状态检查的成本暴露显著的异常线索,我们使用一个轻量级时空GNN评分器fscore在GSTR上计算节点级风险先验p(v)=fscore(v;GSTR)∈[0,1]。所得先验仅用于种子选择和探索引导,而非最终有害性判定。由于GSTR和GSTS节点对齐,这些先验可以直接提升到GSTS,以引导下游全状态探索。
基于检查器的可疑子图探索。节点级风险先验有助于定位可疑节点,但不足以恢复可疑传播,因为后者需要一个结构上连贯的区域,尊重时间连续性和跨智能体通信依赖。因此,我们将这一过程形式化为在全状态图GSTS上的顺序子图探索,其中检查器从高风险种子开始,规划一系列节点选择动作,逐步引出紧凑的可疑传播子图。给定提升后的先验p(v),我们选择GSTS中前K个节点作为探索种子。对于每个种子vseed,我们将可疑子图初始化为H0=({vseed},∅),并将可见图相似文章
PolicyGuard:面向LLM代理政策遵从性的对话基础子代理验证器
PolicyGuard是一种子代理验证器,通过在多轮交互中提供上下文推理和对话特定反馈,增强LLM代理的政策遵从性,在tau^2-BENCH基准上取得了显著改进。
通过溯源分析防范LLM代理失对齐
本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。
PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors
# Paper page - PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors Source: [https://huggingface.co/papers/2605.06455](https://huggingface.co/papers/2605.06455) ## Abstract PrefixGuard enables effective online monitoring of LLM agents through trace analysis and prefix\-based risk scoring, demonstrating strong performance across multiple benchmark tasks while providing diagnostic insights for alert reliability\. Large language model \(LLM\) agents now execute long, tool\-using ta
SafeHarbor:面向LLM代理安全的分层记忆增强护栏
SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。
迈向可安全审计的大模型智能体:一种统一的图表示方法
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。