MemAudit:通过因果归因与结构异常检测对受污染代理记忆进行事后审计

arXiv cs.AI 论文

摘要

MemAudit 是一种针对记忆增强型 LLM 代理的事后审计框架,它通过结合反事实影响分数和结构异常检测来识别受污染的记忆,在现实场景中将攻击成功率从超过 70% 降低至 0%。

arXiv:2605.23723v1 公告类型:新 摘要:大型语言模型代理越来越依赖持久化记忆来存储过去的交互、检索相关示例并改进长周期任务的执行。然而,这种记忆机制也带来了现实的安全漏洞:对抗性用户可以通过普通交互向代理的记忆中注入恶意记录,这些记录随后可能被检索以引导代理的推理和行动。现有的防御措施主要专注于在线干预,例如提示过滤或输出阻止,但并未解决在有害行为发生后,哪些存储的记忆应负责的事后问题。我们提出 \textbf{MemAudit},一种针对记忆增强型 LLM 代理的事后因果记忆审计框架。该框架结合两种互补信号:(1) 反事实记忆影响分数,用于衡量每个记忆对有害输出的因果贡献;(2) 记忆一致性图,用于识别整个记忆库中的结构异常记忆。我们针对 MINJA(一种仅查询的记忆注入攻击)对 MemAudit 进行评估,该攻击通过正常的代理交互生成并存储恶意记录,而非直接修改记忆库。在问答和推理代理两种设置中,MemAudit 在现实的事后审计场景下显著降低了攻击成功率。结果显示,问答攻击成功率从 $70\%$ 降至 $0\%$,而 RAP 攻击成功率从 $83.3\%$ 降至 $0\%$。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:59

# MemAudit:通过因果归因与结构异常检测对受污染智能体记忆进行事后审计
来源:https://arxiv.org/html/2605.23723
谭哲文1,2,3,4,姚逸伦2,3,金慧妍3,余文翰2,3,王国安3,范梦媛3,卢亮1,4,刘峰1,4,张向征2,马多贺1,4,杨彤311footnotemark:1,孙林211footnotemark:1
1中国科学院信息工程研究所 2奇元科技 3多媒体信息处理实验室,北京大学计算机学院 4中国科学院大学网络空间安全学院
通讯作者:马多贺:maduohe@iie\.ac\.cn (https://arxiv.org/html/2605.23723v1/mailto:[email protected]),杨彤:yangtong@pku\.edu\.cn (https://arxiv.org/html/2605.23723v1/mailto:[email protected]),孙林:sunlin1@360\.cn (https://arxiv.org/html/2605.23723v1/mailto:[email protected])

###### 摘要

大型语言模型智能体越来越依赖持久记忆来存储过去的交互、检索相关示范并改进长程任务执行。然而,这种记忆机制也带来了一种实际的安全漏洞:对抗性用户可能通过普通交互将恶意记录注入智能体的记忆,这些记录随后可能在检索时被用来引导智能体的推理和行为。现有防御主要关注在线干预,例如提示过滤或输出阻断,但并未解决在观察到有害行为后,哪些存储的记忆应承担责任的“事后”问题。我们提出 **MemAudit**,一种用于记忆增强型LLM智能体的事后因果记忆审计框架。该框架结合了两种互补信号:(1) 反事实记忆影响分数,用于衡量每条记忆对有害输出的因果贡献;(2) 记忆一致性图,用于识别全局记忆存储中结构异常的记忆。我们针对 MINJA(一种仅通过查询即可实现的记忆注入攻击,其中恶意记录通过正常的智能体交互生成并存储,而非直接修改记忆库)评估了 MemAudit。在问答和推理智能体两种场景下,MemAudit 在现实的事后审计设置中显著降低了攻击成功率。结果表明,问答攻击成功率从70%降至0%,而 RAP 攻击成功率从83.3%降至0%。

## 1 引言

大型语言模型智能体正迅速从被动的对话助手演变为能够与外部环境交互并执行复杂长程任务的自主系统(Yao等人,2022b (https://arxiv.org/html/2605.23723#bib.bib10))。诸如 OpenHands 等最新的智能体系统表明,现代智能体已经能够执行现实的软件工程、网页交互、命令执行和多步规划任务,从而使其越来越多地融入日常工作中,例如软件开发、个人助理、信息管理和在线自动化(Wang等人,2024 (https://arxiv.org/html/2605.23723#bib.bib7))。随着这些系统能力的增强,用户也开始将越来越敏感的权限和决策权委托给智能体。

这一趋势极大地提升了自主智能体的安全风险。一旦智能体执行了不安全或被操控的操作,所造成的损害可能远超单次错误的文本生成。有害行为可能通过将错误决策传播到外部系统和长期运行的用户工作流中,从而引发严重的现实后果(Ferra等人,2025 (https://arxiv.org/html/2605.23723#bib.bib23))。因此,确保自主智能体的可靠性和安全性正成为其实际部署中的关键挑战。

现代智能体能力提升的一个重要因素是持久记忆的使用(Lewis等人,2020 (https://arxiv.org/html/2605.23723#bib.bib1))。许多最新的智能体持续存储观察结果、推理轨迹、用户偏好和历史交互,以支持跨会话的自适应决策(Shinn等人,2023 (https://arxiv.org/html/2605.23723#bib.bib11))。外部记忆使智能体能够随时间积累经验并支持长程适应,而不是作为无状态生成器运行(Wang等人,2023 (https://arxiv.org/html/2605.23723#bib.bib9))。这种设计显著提升了长程推理、个性化和行为一致性(Park等人,2023 (https://arxiv.org/html/2605.23723#bib.bib8))。然而,该机制也引入了一个危险的新攻击面:一旦恶意信息被写入记忆,它可能在未来的交互中保持活跃,并反复影响智能体的行为。

最近的研究表明,此类记忆攻击在已部署的智能体系统中是可行的。MINJA 证明了对手可以通过自然交互将恶意推理轨迹注入智能体记忆,从而导致未来场景中延迟且持久的行为操控(Dong等人,2025 (https://arxiv.org/html/2605.23723#bib.bib13))。更重要的是,这些攻击通常具有高度隐蔽性,因为原始的投毒交互可能看似无害,而有害行为只在部署后期才显现。

尽管记忆投毒威胁日益增长,现有研究仍主要关注**在线防御**(Dong等人,2024 (https://arxiv.org/html/2605.23723#bib.bib18))。然而,实际部署往往遵循一种截然不同的失败模式。在实践中,智能体的有害行为常常是在部署后通过异常行为、意外日志或用户报告才被发现。一旦此类失败已经发生,核心问题不再是如何阻断单次响应,而是如何确定**哪些具体的记忆条目导致了该失败**。

为了解决这一挑战,我们提出 **MemAudit**,一个用于记忆增强型LLM智能体的事后因果审计统一框架。图1 (https://arxiv.org/html/2605.23723#S1.F1) 展示了整体流程。我们框架的核心直觉是,有害记忆表现出两种互补特性。首先,它们应该对有害输出具有可测量的**因果影响**。其次,它们通常在结构上与整体记忆分布**不一致**。基于这一直觉,MemAudit 结合了两种互补信号:(1) 反事实记忆影响分数,通过重放式干预估计每条记忆的因果贡献;(2) 结构异常检测器,用于识别全局记忆图中语义不一致的记忆模式。通过融合这些信号,MemAudit 能够在没有预言式毒化标签的情况下识别可疑记忆。

参照图注图1:MemAudit 概览。给定一个有害事件 \(e=(q^*, y^*, R^*)\),该框架对记忆存储进行事后审计。它结合了两种互补信号:CMIS,通过反事实重放测量检索记忆的因果贡献;以及 MCG,识别全局记忆图中的结构异常记忆。这两个信号融合成一个解毒分数,用于对可疑记忆进行排序。移除排名靠前的记忆后,智能体变得更安全,同时保留有用的记忆。我们在基于交互的记忆注入攻击 MINJA 下,在现实的事后设置中评估了 MemAudit。在问答和 RAP 场景中,MemAudit 在针对性移除记忆后持续降低了攻击成功率。在问答设置中,GPT-4o 上的 ASR 从 70.0% 降至 0.0%,而 RAP 攻击成功率在 GPT-4o 上从 83.3% 降至 0%。

我们的贡献总结如下:

- •据我们所知,本工作首次将**事后因果记忆审计**公式化为一个实际的安全问题,针对的是交互诱导下的记忆投毒对记忆增强型LLM智能体的影响。
- •我们提出了 MemAudit,一个双信号事后审计框架,结合了反事实因果归因与结构异常检测,以在无需毒化标签的情况下识别并移除可疑记忆。
- •我们在现实的记忆注入设置下评估了 MemAudit,并表明它能在问答和长程推理智能体两种场景中大幅降低攻击成功率,同时也揭示了当投毒变得密集时的清晰工作边界。

## 2 相关工作

#### 针对LLM智能体的记忆投毒攻击。

关于LLM系统安全的早期研究主要关注单次交互范围内的攻击,例如提示注入或不安全指令遵循(Greshake等人,2023 (https://arxiv.org/html/2605.23723#bib.bib17))。随着智能体架构开始整合外部记忆和跨会话经验复用,威胁模型从瞬态上下文操纵扩展到了持久状态损坏。这种转变对于记忆增强型智能体尤为重要,因为一旦恶意内容被存储,它可以被反复检索,并在远超原始交互的范围内影响未来决策。AgentPoison 表明,污染外部记忆或检索语料库会在检索和推理过程中诱发下游后门行为(Chen等人,2024 (https://arxiv.org/html/2605.23723#bib.bib12))。MINJA 进一步推进了威胁模型,移除了直接访问数据库的假设:相反,攻击者通过普通交互注入恶意轨迹,并使其通过正常的智能体流程写入记忆(Dong等人,2025 (https://arxiv.org/html/2605.23723#bib.bib13))。后续工作再次拓宽了攻击面。MemoryGraft 表明,被污染的经验可以通过利用智能体模仿先前成功轨迹的倾向,造成持久的行为漂移(Srivastava 和 He,2025 (https://arxiv.org/html/2605.23723#bib.bib14)),而最近的工作则表明,在网页智能体场景中,记忆投毒也可能通过环境观察间接产生(Zou等人,2026 (https://arxiv.org/html/2605.23723#bib.bib4))。

#### 记忆增强型智能体的防御。

防御文献遵循了一条相关但不同的轨迹。关于LLM安全的早期工作主要强调在线防护,包括运行时过滤、提示清理和响应审核,目标是在推理时阻断不安全行为(Dong等人,2024 (https://arxiv.org/html/2605.23723#bib.bib18))。关于越狱防御与对齐的更广泛综述进一步系统化了这一思路,但它们主要将安全视为一个响应时间控制问题,而非一个持久的记忆状态问题(Yi等人,2024 (https://arxiv.org/html/2605.23723#bib.bib20))。随着记忆投毒威胁变得更加具体,较新的防御开始更接近记忆层本身。A-MemGuard 引入了主动记忆验证和双记忆设计,以减少有害记忆条目在检索时被使用的几率(Wei等人,2025 (https://arxiv.org/html/2605.23723#bib.bib27))。Sunil 等人探索了信任评分和记忆消毒机制,以减少可疑记忆条目的影响(Sunil等人,2026 (https://arxiv.org/html/2605.23723#bib.bib28))。Bhardwaj 进一步提出了一种基于贝叶斯信任的记忆防御,以提高在投毒设置下的检索可靠性(Bhardwaj,2026 (https://arxiv.org/html/2605.23723#bib.bib29))。这一进展标志着视角的重要转变:这些方法不再仅保护模型的输出,而是试图控制哪些记忆被视为智能体的可信输入。然而,它们仍然是预防性或在线防御,而非审计方法:它们旨在在运行过程中阻断或减少有害记忆的影响,而不是在观察到有害行为后确定哪些存储的记忆是实际责任方。

## 3 预备知识

我们考虑维护外部记忆存储以跨交互积累和复用信息的记忆增强型LLM智能体。形式化地,令记忆存储为

\[
M=\{m_1, m_2, \dots, m_n\},
\] (1)

其中每个记忆项 \(m_i\) 是一条文本条目。给定用户查询 \(q\),智能体检索一个内存子集

\[
R(q, M) \subseteq M,
\] (2)

并产生输出

\[
y = f\bigl(q,\; R(q,M)\bigr),
\] (3)

其中 \(f\) 表示智能体的生成策略。这个公式化抓住了记忆增强型智能体的一个关键属性:智能体的行为不仅依赖于当前查询,还依赖于从先前交互中积累的信息。在这个设置中,我们研究在有害行为已被观察到之后的事后记忆审计。我们将有害事件形式化为

\[
e = (q^*, y^*, R^*),
\] (4)

其中 \(q^*\) 是触发查询,\(y^*\) 是观察到的有害输出,\(R^*\) 是检索到的记忆上下文。在实际中,\(R^*\) 可能并非总是被显式记录;必要时,可以使用相同的检索机制重建。我们设置的一个关键特征是非预言式可观察性。审计员无法获得真实毒化标签或攻击者目标。相反,它必须仅从可观察的失败(例如任务错误或不安全动作)进行推理。我们假设对手可以插入或影响 \(M\) 中的一部分记忆条目,例如通过交互诱导的记忆更新,而非直接修改外部检索语料库。这些条目旨在在被检索时改变未来行为。审计员可以访问记忆存储 \(M\)、一组有害事件 \(\mathcal{E}\) 以及智能体或重放接口,但无法进行在线干预或获取预言式攻击注释。给定记忆 \(M\) 和一组有害事件

\[
\mathcal{E} = \{e_1, \dots, e_T\},
\] (5)

我们的目标是识别一个子集 \(S \subseteq M\),使得移除 \(S\) 能减少审计后的有害行为:

\[
\min_{S} \ \text{HarmAfter}(M \setminus S).
\] (6)

这个目标抓住了事后记忆审计的核心目标:识别那些移除后能有效净化智能体的可疑记忆,这些操作是在有害行为已被观察到之后进行的。挑战在于,在无法获取预言式毒化标签或攻击者侧信息的情况下,从完整记忆存储中隔离出少数有影响力的记忆条目。

## 4 方法

我们提出 **MemAudit**,一个事后审计框架,用于在观察到有害行为后对可疑记忆进行排序以便针对性移除。给定一个有害事件,该框架从两个互补视角对候选记忆进行评分:它们对观察到的失败的**事件级因果效应**,以及它们在记忆存储中的**全局结构不一致性**。这两个信号随后融合成一个用于记忆净化的单一排名。对于一个有害事件 \(e = (q^*, y^*, R^*)\),我们通过将每条检索记忆从记忆存储中移除并重放该事件来估计其贡献。我们将反事实记忆影响分数定义为

\[
\text{CMIS}(m_i) = h(q^*, y^*) - h\bigl(q^*, f(q^*, R(q^*, M \setminus \{m_i\}))\bigr),
\] (7)

其中 \(h(\cdot)\) 是一个危害评分函数。更大的 CMIS 值表明移除 \(m_i\) 会导致有害行为减少更多,暗示该记忆在观察到的失败中扮演了更强的因果角色。由于该分数是通过重放式干预计算的,它直接捕捉了查询-记忆交互效应。在

相似文章

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。

误判鸿沟:当记忆投毒在自主AI系统中看似模型故障

arXiv cs.AI

本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。

有限记忆语言模型中的遗忘审计

arXiv cs.CL

本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。