工具增强LLM系统中的持久语义实体

arXiv cs.LG 论文

摘要

本文形式化了工具增强型LLM代理中的持久语义实体(PSE),表明隐式状态会跨会话持续存在并可能被利用,所有测试模型都易受偏好和指令污染的影响。

arXiv:2608.07952v1 公告类型:新 摘要:工具增强的LLM智能体可能包含隐式状态,这些状态会跨会话持久存在、通过事件激活,并跨智能体边界传播——这在很大程度上对标准调试不可见。我们将其形式化为持久语义实体(PSEs):由名称绑定、事件触发和跨边界传播定义的构造,并在来自11个家族的24个模型(1.5B--1T参数)上进行了评估。首先,每个测试模型都易受影响(20模型易感性面板上为20--100%),其中名称绑定是必要且主导的机制:没有它,污染为0%。其次,持久性取决于污染类型而非规模或部署方式:偏好污染在每个探测模型上都不衰减地持续(t=10时为100%),指令污染在任何采用处都持续存在,角色风格注入部分衰减(90%$\to$10%),而事实注入则依赖模型——在Llama-3.1-8B和GPT-4o-mini上可自我纠正,但在两个Qwen2.5-coder变体上保持上限,因此我们不声称它普遍能自我纠正。在我们的受控设置中,偏好和指令结果在不同提供者间保持一致。第三,上下文隔离的自我验证在无预言机参考的情况下实现了20--79%的降低(中位数36.5%),而基于关键词的检测会产生系统性误报,并且污染沿四阶段智能体流水线复合1.9$\times$(40%$\to$75%)。偏好和指令污染——持久、缺乏自我纠正、且标准监控难以捕捉——对已部署的智能体系统构成了尤其令人担忧的攻击面。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# 工具增强型LLM系统中的持久化语义实体

来源:https://arxiv.org/html/2608.07952

###### 摘要

工具增强型LLM智能体可能携带跨会话持续存在、通过事件激活并在智能体边界间传播的隐式状态——而标准调试对此几乎不可见。我们将其形式化为*持久化语义实体*(Persistent Semantic Entities, PSE):由名称绑定、事件触发和跨边界传播定义的构造,并在来自11个家族的24个模型(1.5B–1T参数)上进行了评估。首先,每个测试模型都易受影响(20模型敏感性面板上为20–100%),其中名称绑定是必要且主导的机制:没有它,污染率为0%。其次,持久性取决于污染*类型*而非规模或部署方式:偏好污染在每个探测模型上均不衰减地持续(在t=10时为100%),指令污染一旦被采纳便持续存在,角色风格注入部分衰减(90%→10%),而事实注入则*依赖模型*——在Llama-3.1-8B和GPT-4o-mini上可自我纠正,但在两个Qwen2.5-coder变体上却保持在最高水平,因此我们不能声称其普遍会自我纠正。偏好和指令结果在我们的受控环境中跨提供商成立。第三,上下文隔离的自我验证可在无需标准答案的情况下实现20–79%的降低(中位数36.5%),而基于关键词的检测会产生系统性误报,且污染沿四阶段智能体流水线以1.9×累积(40%→75%)。偏好和指令污染——持久、缺乏自我纠正、且难以被标准监控捕获——对已部署的智能体系统构成尤其令人担忧的攻击面。

大语言模型、智能体系统、状态管理、调试、安全

## 1 引言

当LLM智能体会话结束时,还会保留什么状态?传统答案是:没有,或者只有被显式保存的部分。工具注册被清除,事件订阅过期,中间计算消失。这一假设是开发者推理智能体行为和安全的基础。

但这一假设并不总是成立。在工具增强型智能体系统(Schick et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib20); Qin et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib19))如LangChain(Chase,2023 (https://arxiv.org/html/2608.07952#bib.bib2))、AutoGPT(Significant Gravitas,2023a (https://arxiv.org/html/2608.07952#bib.bib23))和CrewAI(Moura,2024 (https://arxiv.org/html/2608.07952#bib.bib15))中,隐式状态可以通过规避常规清理的机制持续存在。以特定名称注册的工具在显式注销之前一直保持绑定。事件订阅在显式取消之前持续触发。一个会话期间序列化的状态会被反序列化到下一个会话中。

考虑一个具体例子:AutoGPT的插件系统(Significant Gravitas,2023a (https://arxiv.org/html/2608.07952#bib.bib23))允许第三方扩展执行任意代码并注册命令处理器。恶意插件可以注册一个处理器,通过序列化状态在智能体重启后持续存在,拦截合法命令并窃取数据,而标准日志记录对此几乎不可见(我们在§5 (https://arxiv.org/html/2608.07952#S5)中分析了一个机制级场景)。这并非AutoGPT独有;它反映了一*类*隐式状态,只要系统将基于名称的注册、事件驱动的激活和状态传播结合起来,就会出现这类状态。

我们将其形式化为**持久化语义实体**(PSE),其特点是三种机制:

1. **名称绑定**:实体通过字符串标识符注册,行为通过名称到处理器的映射触发。一个注册为“calculate”的工具只要名称绑定存在就一直存在。
2. **事件触发**:通过隐式事件(工具回调、错误处理器、生命周期钩子)激活,使休眠状态无需显式调用即可“复活”。
3. **传播**:一次触发可在多次执行中级联,可能通过共享注册表或序列化状态跨越工具、智能体和会话边界。

与内存泄漏或缓存产物不同,PSE抵抗常规调试,因为它们在*语义*层面运作:通过名称和事件而非显式数据流。图1 (https://arxiv.org/html/2608.07952#S1.F1)展示了三种机制及其产生的类型依赖性持久性,表1 (https://arxiv.org/html/2608.07952#S1.T1)将PSE与相关现象进行了对比。

表1:PSE与相关现象的对比。PSE独特地结合了所有三种机制且可观测性极低。

##### 运行示例。在一个多智能体数据流水线中,智能体A注册了一个名为`normalize_data`的转换器,并带有对特定日期格式(ISO-8601)的偏好。这些偏好持久保存在一个共享注册表中。当智能体B后来以期望MM/DD/YYYY格式调用同一工具名称时,它收到的是ISO-8601日期:这就是没有显式数据共享的行为污染。标准日志只显示一次成功的工具调用;污染路径不可见,而智能体B的下游分析产生了错误结果。

##### 研究问题。我们研究:(1) PSE污染在不同模型和上下文中有多普遍、多严重?(2) 污染会随时间自然衰减,还是持续存在?(3) 哪些防御机制能有效缓解PSE风险?

##### 贡献。我们的工作有三个主要贡献:

**概念性。** 我们将持久化语义实体形式化为元组\((N,T,P)\),捕获名称绑定、事件触发和传播,从而将PSE与内存泄漏、缓存产物和显式会话状态区分开来(§3 (https://arxiv.org/html/2608.07952#S3))。

**经验性。** 通过在二十模型、十家族敏感性面板(OpenAI、Anthropic、Google、Meta、Alibaba、DeepSeek、Mistral、Zhipu、Moonshot、Deep Cogito)上、覆盖1.5B到1万亿参数规模,加上防御对比中的四个额外模型(总共24个模型、11个家族)进行的受控实验,我们确定:(i) PSE易感性影响所有测试模型家族,包括Claude(88%)和Gemini(84–96%),并具有显著异质性(20–100%的污染率,且在匹配的n=7规模扫描中无法解析出规模效应,R²=0.25,p=0.256);(ii) 任务上下文与模型选择同样重要——在相同的注入机制下,安全分析任务的污染率达到98.9%,几乎是信息检索(36.7%)或代码推荐(27.8%)上下文的三倍;(iii) 偏好和指令污染在Llama-3.1-8B上经过10轮后不衰减(t=10时为100%,n=10,95% Wilson CI[0.72,1.00]),而事实污染则一致地自我纠正(0%,CI[0,0.28]);角色风格污染显示部分衰减(t=0时为90%下降到t=10时的10%)(§4 (https://arxiv.org/html/2608.07952#S4))。

**实用性。** 我们评估了多种模型上的防御方法,发现上下文内自我反思提供的保护高度不一致,从-14%(Claude-Sonnet-4上污染*增加*)到+45%不等,在GPT-4o-mini上完全没有降低;而上下文隔离的自我验证(无标准答案)实现了78.6%的降低,外部验证(SRV)实现50–100%(中位数100%)。我们将该框架落地到已部署智能体框架的机制级案例重建中,包括AutoGPT插件持久性(§5 (https://arxiv.org/html/2608.07952#S5))。

##### 利益冲突披露。作者声明没有财务利益冲突。本工作在南加州大学完成;作者与本文评估的任何模型提供商(OpenAI、Anthropic、Google、Meta、Alibaba、DeepSeek、Mistral、Zhipu、Moonshot)或所讨论的智能体框架项目(LangChain、AutoGPT、CrewAI、MCP)均无雇佣、咨询或股权关系。实验中使用的商业API均按标准公共定价访问,没有特殊访问权限、折扣或赞助。

图1 (https://arxiv.org/html/2608.07952#S1.F1):PSE机制概览。(A) 名称绑定在字符串标识符下注册处理器,使被投毒的处理器能够遮蔽合法工具。(B) 事件触发通过隐式运行时事件重新激活休眠绑定,无需用户显式调用。(C) 传播通过共享注册表和序列化状态将污染扩散到多轮、同级智能体及未来会话。底部:Llama-3.1-8B第10轮的污染情况(n=10);偏好和指令污染保持在100%,角色风格部分衰减至10%,事实污染被一致地自我纠正至0%。

## 2 相关工作

**工具增强型LLM智能体。** ReAct范式(Yao et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib32))确立了将推理与工具使用相结合的智能体。现代框架(Schick et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib20); Qin et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib19); Patil et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib17); Wu et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib31); Hong et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib12); Chase,2023 (https://arxiv.org/html/2608.07952#bib.bib2); Packer et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib16))通过显式记忆模块和工具注册表管理状态。这些系统假设显式状态管理就够了——我们的工作表明隐式状态通过命名和事件机制持续存在,而这些机制绕过了这些抽象。

**提示注入与上下文攻击。** 提示注入(Schulhoff et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib21); Greshake et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib11))通过对抗性输入操纵模型行为;越狱(Wei et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib29))绕过安全约束。防御方法包括指令层级结构(Wallace et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib25))和宪法AI(Bai et al.,2022 (https://arxiv.org/html/2608.07952#bib.bib1))。关键区别:提示注入——包括在单轮内劫持应调用哪个工具的工具选择注入(Zhan et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib33))——在单个上下文窗口内运作;PSE污染增加了正交的维度,即*跨轮次的持久性和传播*,以名称绑定为主导杠杆。

**智能体安全与记忆投毒。** AgentDojo(Debenedetti et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib7))、InjecAgent(Zhan et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib33))和Agent Security Bench(Zhang et al.,2025 (https://arxiv.org/html/2608.07952#bib.bib34))系统性地评估了智能体漏洞。AgentPoison(Chen et al.,2024b (https://arxiv.org/html/2608.07952#bib.bib4))和最近的记忆投毒工作(Devarangadi Sunil et al.,2026 (https://arxiv.org/html/2608.07952#bib.bib8))——后者已经刻画了基于记忆的智能体中的持久性——通过数据层解决持久化破坏;PSE贡献了正交的维度,即通过名称绑定和事件订阅实现的*语义级*持久性,这甚至出现在没有显式记忆模块的系统中。针对MCP服务器的工具级攻击(Wang et al.,2025c (https://arxiv.org/html/2608.07952#bib.bib28))和智能体记忆操纵(Dong et al.,2025 (https://arxiv.org/html/2608.07952#bib.bib9))针对的是PSE所形式化的基础设施层。包括AgentSentry(Zhang et al.,2026 (https://arxiv.org/html/2608.07952#bib.bib35))和MindGuard(Wang et al.,2025b (https://arxiv.org/html/2608.07952#bib.bib27))在内的防御框架处理特定的攻击向量。我们的框架补充了这些工作,通过形式化*持久性机制*——即\((N,T,P)\)元组——而非单个注入向量。

**模型崩溃与迭代退化。** 模型崩溃(Shumailov et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib22))描述了模型在自己的输出上训练时出现的性能下降。我们将其与多智能体PSE传播进行类比:一个智能体的受污染输出成为下一个智能体的输入,从而在流水线中加剧退化。在智能体边界进行外部验证可以打破这一循环,这与新鲜训练数据的作用相呼应。

**RAG安全。** 检索增强生成通过被投毒文档引入攻击面(Zou et al.,2024 (https://arxiv.org/html/2608.07952#bib.bib37); Zhong et al.,2023 (https://arxiv.org/html/2608.07952#bib.bib36))。我们的实验显示RAG上下文中基准污染率为65%。

**调试与可观测性。** 基于追踪的调试(Chen et al.,2024a (https://arxiv.org/html/2608.07952#bib.bib3))和分布式追踪假设存在显式状态通道。PSE绕过了这些工具,这解释了为什么增强日志记录(捕获注册表变更和事件订阅)能带来50个百分点的改进。

## 3 方法论

### 3.1 系统与对手模型

PSE现象源于模型与其周围运行时的*交互*;如§4.3 (https://arxiv.org/html/2608.07952#S4.SS3)中的机制消融所示,单独任何一方都无法解释观察到的行为。我们考虑工具增强型LLM智能体系统,其组成包括:无状态推理引擎、名称到处理器的*工具注册表*、带生命周期钩子的*事件系统*、持久*记忆存储*,以及用于多智能体协调的*智能体编排器*。虽然推理引擎是无状态的,但周围基础设施维护着跨推理调用和智能体边界持久存在的隐式状态。

我们定义三个对手层级:
- **Tier-1(内容注入)**:可以通过文档、网页或API响应向智能体输入中注入内容;
- **Tier-2(注册表操纵)**:还可以通过恶意插件或被攻陷的依赖影响工具注册;
- **Tier-3(事件订阅)**:还可以订阅系统事件并影响调度顺序。

我们排除需要直接访问模型权重或训练数据的攻击。每项策略的可复现性卡片(提示模板、触发事件、传播通道、判定谓词)随代码工件发布(附录E (https://arxiv.org/html/2608.07952#A5))。

### 3.2 形式定义

令\(\mathcal{S}\)表示标识符(字符串)集合,\(\mathcal{H}\)表示处理器(执行逻辑)集合,\(\mathcal{V}\)表示事件集合,\(\mathcal{C}\)表示执行上下文集合。一个**持久化语义实体**(PSE)是元组\((N,T,P)\),其中:

- \(N: \mathcal{S}\rightarrow\mathcal{H}\) 是**名称绑定**函数,将标识符映射到处理器
- \(T: \mathcal{V}\rightarrow 2^{\mathcal{S}}\) 是**事件触发**函数,将事件映射到被激活绑定的集合
- \(P: \mathcal{S}\times\mathcal{C}\rightarrow 2^{\mathcal{S}\times\mathcal{C}}\) 是**传播**函数,将(绑定,上下文)对映射到下游激活

当存在\(s\in\mathcal{S}, c_{1}\neq c_{2}\in\mathcal{C}\)使得\((s,c_{2})\in P(s,c_{1})\)——即效应在没有显式状态转移的情况下跨不同上下文传播——时,PSE表现出*持久性*。一个具有PSE韧性的系统应当满足:**名称绑定完整性**(只有授权来源可以绑定处理器)、**事件隔离**(在\(c_{1}\)中的订阅不能在\(c_{2}\)中触发)、以及**传播有界性**(所有链的长度有限,\(\leq k\))。

**污染。** 我们在操作层面上将*污染*定义为由PSE状态引起的、与预期行为的可测量偏差。令\(f_{\theta}(x)\)表示模型对输入\(x\)的输出。

相似文章

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。

论词汇性在大语言模型中的持续影响

arXiv cs.CL

本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。

大规模代理:持久代理的感知中心架构

Hugging Face Daily Papers

本文提出了一种面向持久语言代理的感知中心架构(Pera),该架构通过感知任务、上下文和环境变化中的信号,持续适应服务流程。它组织了现有工作,并为构建更强大的持久代理提供了见解。

状态承诺学习:训练语言模型区分计算与记忆

arXiv cs.LG

本文介绍了状态承诺学习,这是一种训练目标,旨在教会语言模型区分临时计算令牌与持久状态令牌。作者提出了反事实擦除强化学习(CERL)和擦除依赖协议,在数学、逻辑、科学问答以及工具使用任务中展示了改进,且未牺牲准确性。