误判鸿沟:当记忆投毒在自主AI系统中看似模型故障
摘要
本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。
arXiv:2605.22842v1 公告类型:交叉\n摘要:多智能体AI流水线通常假设智能体行为不当源于模型失调。我们识别了这一假设中的结构性缺陷,即“误判鸿沟”,其中记忆层攻击产生的行为与模型故障无法区分,导致防御者应用错误的修复措施。我们正式定义了语义规范漂移(SND)作为智能体行为不当的第三条路径,区别于突发失调和合谋。在SND中,一份策略格式的文档通过正常上传进入共享向量存储,随后在经历信任洗钱链丢失来源后,重新作为可信系统上下文出现。在64个记录在案的故障中,归因系统始终将责任归咎于模型。四个安全分类器,包括一个基于记忆投毒训练的,在510个检查点中未产生任何检测。在65个有效案例中的59个,智能体在遵守前明确将注入文档引用为规范权威。该攻击无需触发条件、模型访问或重复交互,在五个会话内达到完全效果,并无限持续。我们引入了反事实组合测试,以87.5%的准确率和零误报识别因果入口,而取证基线在所有25个场景中均失败。我们进一步证明了检索覆盖困境,表明更强的规避本质上削弱了攻击,限制了自适应绕过策略。最后,我们提出了持久记忆信息流控制,在跨会话边界处阻止了97%的攻击,而先前的防御在此处失效。我们发布了SND语料库,这是首个具有时间持久性和多智能体组合的对抗性记忆基准,覆盖金融和医疗保健领域。
查看缓存全文
缓存时间: 2026/05/25 09:01
# 归因差距:当内存中毒看起来像代理AI系统中的模型失效时
来源:https://arxiv.org/html/2605.22842
Tanzim Ahad¹, Ismail Hossain¹, Md Jahangir Alam¹, Sai Puppala², Syed Bahauddin Alam³, Sajedul Talukder¹
¹德克萨斯大学埃尔帕索分校计算机科学系,美国德克萨斯州埃尔帕索 79902
²南伊利诺伊大学卡本代尔分校计算学院,美国伊利诺伊州 62901
³伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州
{tahad, ihossain, malam10}@miners.utep.edu
[email protected], [email protected], [email protected]
https://supreme-lab.github.io/snd/
###### 摘要
多智能体AI流水线共享一个假设:当智能体行为不当时,问题出在模型上。对其进行红队测试,然后重新训练。我们识别出这种剧本中的结构性失败——归因差距——攻击者可以故意利用它。内存层攻击产生的痕迹与模型失配完全一致,因此对模型问题的正确响应反而成为对内存攻击的错误响应。我们证明了这一点:在所有64个已记录的失效案例中,归因系统都自信地将责任归咎于模型。
我们将语义规范漂移(Semantic Norm Drift, SND)形式化为通向智能体不当行为的第三条结构性独立路径,与新兴失配和秘密勾结正交。一份策略格式的文档通过正常上传进入共享向量存储,并通过信任洗钱链(Trust Laundering Chain)在未来的会话中重新出现,成为受信任的系统上下文,其来源永远丢失。四个安全分类器(包括一个针对内存中毒训练的)在510个检查点中返回零检测。在65个有效条目中,有59个智能体在其推理中引用注入的文档作为规范权威,然后遵从。无需触发器、无需模型访问、无需重复交互。在五个会话内达到完全效果,并无限期持续。
反事实组合测试(Counterfactual Composition Testing, CCT)以87.5%的准确率和零误报识别因果条目,而针对所有25个场景的取证基线完全盲目。检索覆盖困境(Retrieval-Coverage Dilemma)证明,规避在结构上要求削弱攻击,并且能够抵御击败12种已发布防御的自适应绕过。内存持久信息流控制(Memory-Persistent Information-Flow Control, MP-IFC)在跨会话边界阻止了97%的攻击,而现有最先进技术在所有信息性案例中均失败。我们发布了SND语料库(SND Corpus),包含70个经过滤器验证的条目,具有金融和医疗保健领域的因果真实数据,作为首个结合时间持久性和多智能体组合的对抗性内存基准。
## 1 引言
考虑一家企业部署了一个三智能体AI流水线来自动化财务报告:一个智能体从数据库提取客户记录,第二个总结监管趋势,第三个编写提交给董事会的执行报告。一个季度,合规团队注意到董事会级别的摘要包含原始 `customer_id` 值——直接违反了内部数据治理策略和GDPR第5条。该组织遵循标准的AI治理剧本[Lynch et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx19):它红队测试模型,分析注意力模式,并重新训练。违规行为停止了。一个报告周期后,它又回来了。他们再次重新训练。这个循环无限重复。
模型没有失配。没有攻击者触碰过它。三个月前,一份格式化为合法SOX §302合规策略的文档被上传到流水线的共享ChromaDB知识存储[Chroma Team(2024)](https://arxiv.org/html/2605.22842#bib.bibx6)。在每个报告周期,所有三个智能体都将其检索为权威指南,在其思维链推理中引用它,并包含被禁止的标识符——而所有部署的安全分类器在每个评估检查点都返回安全。治理剧本重新训练模型;中毒条目持续存在;攻击如期返回。
图1 ([https://arxiv.org/html/2605.22842#S1.F1](https://arxiv.org/html/2605.22842#S1.F1))追踪了这一端到端过程:攻击者的单次上传,通过共享内存的无声跨会话放大,在每条边界返回安全的安全分类器堆栈,以及我们开发的三种防御措施来缩小这一差距。
这种失败不是偶然的。它是结构性的。先前的工作已经确立了有害智能体行为的两种范式。在新兴失配(Emergent Misalignment)[Lynch et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx19)中,模型通过训练或RLHF失败发展出有害行为——行为痕迹源于权重。在秘密勾结(Secret Collusion)[Motwani et al.(2024)](https://arxiv.org/html/2605.22842#bib.bibx25)中,智能体通过隐写通道秘密协调——痕迹源于智能体间通信。两者都是模型层或通道层现象。我们建立了第三条结构性正交路径:
诱导失配(Induced Misalignment)。外部攻击者用一份策略格式的文档毒化共享持久内存,诱导智能体产生违反策略的输出,而无需任何模型失效、失配或秘密协调。行为输出——智能体在董事会报告中包含 `customer_id`——在所有三条路径上都是相同的。标准治理通过行为分析区分路径1和路径2;它无法将二者中的任何一个与路径3区分开,因为模型并没有损坏。
参见图注
图1:语义规范漂移(SND)攻击与防御的端到端架构。策略格式的注入进入持久的多智能体系统,所有过滤器返回安全,但组合后的输出变得违反策略(归因差距)。防御措施——MP-IFC、RCM和CCT——执行来源追踪、检测广泛影响,并在关键边界实现因果归因。
表1:通向智能体不当行为的三条结构性独立路径。标准治理响应(红队测试→重新训练)解决了路径1-2,但永久性地使路径3攻击继续存在。
上述治理失败并非启发式弱点——而是模型层审计与内存层攻击交互方式的一个数学性质。
###### 定理1(双流水线不可区分性)。对于由共享内存中含有中毒条目 \(m^*\) 的智能体产生的任意会话日志序列 \(L_1, \ldots, L_T\),都存在一个由真正失配但内存干净的智能体产生的相同序列。模型层审计——红队测试、激活分析、行为重新训练——无法区分两者。
其后果是直接的:当企业对路径3攻击应用标准剧本时,它检查了正确的行为模式,根据可观察证据做出了正确的决策,却作用在了错误的根本原因上。中毒条目持续存在;攻击返回。我们称此为 **归因差距(Misattribution Gap)**。
我们通过语义规范漂移(Semantic Norm Drift, SND)来形式化并演示归因差距:一种只需要文档上传访问权限的内存中毒攻击。一份策略格式的文档被注入共享的ChromaDB向量存储;它被每个未来会话检索为权威指南,导致智能体在组合输出中包含被禁止的数据标识符,而没有任何分类器触发。SND是ATFAA领域2/T3时间持久性威胁[Narajala and Narayan(2025)](https://arxiv.org/html/2605.22842#bib.bibx26)的首次经验实例化,实现了该分类法确定为必要但尚未实施的内容:一种可测量的攻击、一个时间基准和三种防御措施。
五个已发布的锚点确立了这一威胁类别是真实的、正在增长且目前未得到解决。
(A1) 安全评估是无状态的:ToolEmu评估了144个智能体测试用例,每个都从空内存开始;TAME[Cheng et al.(2026)](https://arxiv.org/html/2605.22842#bib.bibx5)发现,在良性内存积累且无对抗注入的情况下,安全性下降;Yu et al.[Yu et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx35)证实,扩展检索访问会降低安全性,即使没有攻击者——SND是已经存在的结构性弱点的对抗性定向版本。
(A2) 没有先前的同行评审论文测量过通过过滤器注入攻击在多会话企业流水线上的有效性;ToolEmu[Ruan et al.(2024)](https://arxiv.org/html/2605.22842#bib.bibx30)和ASB[Zhang et al.(2025a)](https://arxiv.org/html/2605.22842#bib.bibx38)都在 \(T=0\) 时评估。
(A3) MemoryGraft[Srivastava and He(2025)](https://arxiv.org/html/2605.22842#bib.bibx31)表明,约10条中毒记录在单智能体内存中实现了约48%的有害检索,但并未设计用于分类器规避;Lupinacci et al.[Lupinacci et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx18)在 \(T=0\) 时发现了对智能体间信任利用的漏洞;SND是这两篇论文都未研究的组合:通过过滤器 × 多智能体 × 时间积累。
(A4) EchoLeak (CVE-2025-32711, CVSS 9.3) 确认了在Microsoft 365 Copilot中绕过分类器的注入[Reddy and Gujral(2025)](https://arxiv.org/html/2605.22842#bib.bibx29);OWASP将内存中毒(ASI06)列为十大风险之一,且没有部署的检测解决方案。
(A5) Microsoft的Defender团队识别出14个行业的31家公司正在积极毒化AI助手内存,导致MITRE AML.T0080[Kochavi et al.(2026)](https://arxiv.org/html/2605.22842#bib.bibx15), [MITRE Corporation(2026)](https://arxiv.org/html/2605.22842#bib.bibx24);Palo Alto Unit 42确认了AWS Bedrock智能体中的持久注入。
本文提出以下问题:
> 注入共享持久内存存储中的单份通过过滤器的文档,能否在多智能体AI流水线中导致持续的、可分类的有害行为——而现有的取证和安全基础设施是否正确地将其识别为内存攻击而非模型失配?
我们的回答是:是、是、否。我们构建并评估了一个包含70个条目的对抗性语料库(50个金融,20个EHR),覆盖一个具有持久ChromaDB存储的三智能体LangGraph流水线,每个条目在四个分类器安全堆栈(涵盖摄取、检索和组合边界)的20个分类器检查点进行评估。在过滤器规避评估中,92.9%的条目(65/70;95% Wilson CI [84.3%, 96.9%])在所有20个检查点规避了AprielGuard-8B[Kasundra et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx14),在508个评估检查点中返回零检测;相同的分类器在相同的堆栈中标记了100%的MINJA[Dong et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx8)和AgentPoison[Chen et al.(2024)](https://arxiv.org/html/2605.22842#bib.bibx4)条目,这是一种分类反转。在65个有效条目中,有59个智能体的思维链明确引用注入的文档作为包含禁止标识符的规范权威,然后遵从,而所有四个分类器都返回安全。在时间轨迹评估中,模拟56个条目-模型对的20个会话,安全性在五个会话内下降到基线的19.3%,并在会话20中保持平稳。在归因分析中,我们对64个确认有害的条目应用Who&When[Zhang et al.(2025c)](https://arxiv.org/html/2605.22842#bib.bibx39);对数反事实归因将所有64个案例分配给模型失配(\(p=5.21\times10^{-22}\)),经验性地确认了归因差距。治理剧本重新训练模型,却让攻击继续运行。
**贡献。**
1. **诱导失配分类法与形式化证明。** 我们将诱导失配确立为通向智能体不当行为的第三条结构性独立路径,并证明(定理1)模型层审计无法检测内存层攻击。归因差距被正式刻画并在 \(p=5.21\times10^{-22}\) 时经验性确认。
2. **MAJB-64语料库与检索覆盖困境。** 首个结合通过过滤器构建、多智能体评估、时间轨迹数据(20个会话上的CDG、SDR、RSDR)以及两个受监管领域因果真实数据的对抗性内存基准。我们证明,任何减少宽检索覆盖的规避策略都会同时消除攻击有效性——对自适应绕过具有免疫力(25个规避变体上 \(r=0.858\), \(p=4.1\times10^{-8}\))。
3. **可通过两处代码变更部署的防御套件。**
- CCT(反事实组合测试):TPR=0.875, FAR=0.000,而内容取证基线TPR=0.000(McNemar \(\chi^2=21.0\), \(p\approx 0\))。
- RCM(检索集中度监测):AUC=1.000,根据定理2在结构上具有规避抵抗性。
- MP-IFC(内存持久信息流控制):通过两处代码变更实现97.3%的攻击阻断,弥补了FIDES[Costa et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx7)(会话边界标签丢失率91.8%)和A-MemGuard[Wei et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx33)(合法文档阻断率80%)未解决的跨会话差距。
**论文组织。**
第2节将SND置于相关工作格局中。第3节形式化威胁模型和信任洗钱链。第4节描述MAJB-64语料库。第6节报告过滤器规避和时间轨迹结果。第8节呈现防御评估。第9节包含形式化证明和局限性。第10节回到研究问题。
## 2 相关工作
### 2.1 内存中毒与RAG攻击
PoisonedRAG[Zou et al.(2025)](https://arxiv.org/html/2605.22842#bib.bibx41) 向RAG存储中插入少至五个文档即可实现>90%的输出引导,针对检索相关性进行了优化,但无需分类器规避;SND采用了PoisonedRAG的两部分真实性标准(检索条件和生成条件),但反转了约束——每个MAJB-64条目必须看起来像合法的组织策略,通过508个AprielGuard检查点的零检测确认。AgentPoison[Chen et al.(2024)](https://arxiv.org/html/2605.22842#bib.bibx4) 添加了一个后门触发器,需要白盒或黑盒访问嵌入模型几何结构;SND无需触发器——任何语义上域相关的查询都会在设计中检索到 \(m^*\)——也无需了解检索器结构。EchoLeak (CVE-2025-32711, CVSS 9.3)[Reddy and Gujral(2025)](https://arxiv.org/html/2605.22842#bib.bibx29) 展示了在大型生产系统(Microsoft 365 Copilot)中单会话内绕过过滤器的注入;SND研究的是当注入的痕迹跨会话持续存在时的时间与治理后果,此时有害行为不断积累,归因无限期失败。MemoryGraft[Srivastava and He(2025)](https://arxiv.org/html/2605.22842#bib.bibx31) 表明,向单智能体内存中注入大约10个中毒的程序性经验模板(约占110条总记录的9.1%)使用看起来无害的痕迹(README文件、代码片段)且未专门针对内容分类器规避设计,实现了大约48%的有害检索;SND将其扩展到三智能体LangGraph流水线,并使用四分类器评估堆栈(0/508检测)、形式化的多会话指标(CDG、SDR、RSDR)以及相似文章
当智能体记忆过多:针对大语言模型智能体的记忆投毒攻击
本文介绍了GhostWriter,一种新颖的攻击向量,利用基于大语言模型的个人智能体的记忆子系统来毒化其记忆存储,实现了高注入率和激活率。作者提出了AM-Sentry防御机制,在保持智能体实用性的同时显著降低攻击成功率。
基于智能体AI、嵌套学习与语义缓存的幻觉缓解及AI可持续性
本文提出了一种记忆增强的多智能体架构,采用嵌套学习、连续记忆系统和语义缓存来缓解LLM流程中的幻觉问题,在显著减少事实错误的同时提高了运营效率。
MemAudit:通过因果归因与结构异常检测对受污染代理记忆进行事后审计
MemAudit 是一种针对记忆增强型 LLM 代理的事后审计框架,它通过结合反事实影响分数和结构异常检测来识别受污染的记忆,在现实场景中将攻击成功率从超过 70% 降低至 0%。
有人真的解决了记忆漂移问题吗?
讨论AI系统中的记忆漂移问题:偏好和事实会过时,但系统只追加存储新信息,导致版本冲突和检索不可靠。
我们是否低估了AI代理记忆可能带来的危险?
讨论了赋予AI代理记忆的风险,包括信任问题、数据投毒和运营风险,并向构建者提出了关键问题。