新鲜记忆,过时计划:面向分布式LLM代理记忆的依赖作用域验证

arXiv cs.AI 论文

摘要

本文介绍了PlanFence,这是一种依赖作用域的验证协议,通过验证计划与当前公开记录的一致性来防止分布式LLM代理系统中执行过时的计划,并通过受控的实时工作流进行了演示。

arXiv:2609.03340v1 公告类型:新 摘要:分布式LLM代理团队可以读取最新的共享事实,却仍可能执行过时的计划。规划器可能从需求$r_3$推导出一个行动,另一个代理可能提交$r_4$,而执行器可能接收到$r_4$而没有替换从$r_3$推导出的计划。我们将此称为\emph{过时计划执行}:状态的新鲜度并不能确保授权行动的计划仍然有效。我们引入PlanFence,一种依赖作用域的行动验证协议。计划引用它们使用的具体公开记录,执行器只验证可能影响待处理外部行动的记录,在验证不完整时重新规划或阻止。在30个带有计划后修订的受控实时工作流中,仅依赖新鲜度的执行器在每个任务中都执行过时的计划,而PlanFence在没有无效行动的情况下完成了所有任务。受控重放揭示了两个条件边界:主动同步在低流失率下产生较低的协调停滞,而PlanFence随着流失率的增长避免重复的更新路径协调,并随着共享键空间的增长避免验证无关状态。这些是受控的安全性和系统成本结果,并非一般任务准确性的提升。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:03

# 分布式LLM智能体记忆的依赖范围验证  
来源:https://arxiv.org/html/2609.03340  

###### 摘要  
分布式LLM智能体团队能够读取最新的共享事实,却仍可能依据过时的计划行动。规划器可能基于需求r3推导出一个动作,另一个智能体可能提交r4,而执行器可能接收到r4却未替换由r3推导出的计划。我们称此现象为*陈旧计划执行*:状态的时效性并不能证明授权该动作的计划依然有效。  

我们提出**PlanFence**,一种依赖范围内的动作验证协议。计划会引用其使用的精确公共记录,而执行器仅验证可能影响待执行外部动作的那些记录,一旦验证不完整便重新规划或阻断执行。在30个具有计划后修订的受控实际工作流中,仅依赖时效性的执行器在所有任务中均依据过时计划行动,而PlanFence在无无效动作的情况下完成了所有任务。受控回放揭示了两个条件边界:在低变动率下,主动同步可减少协调停顿;随着变动增长,PlanFence避免了重复的更新路径协调,并且在共享键空间扩大时避免了无关状态的验证。这些是受控的安全性与系统成本结果,并非普适的任务准确性提升。  

## 1 引言  
分布式大语言模型(LLM)智能体系统日益将任务分配给规划、检索信息、调用外部工具的专业化角色框架(如AutoGen、MetaGPT、CAMEL和ChatDev)将这些角色组织在不同进程或设备上。智能体可能保留私有上下文和本地工具,同时复制协调所需的公共任务状态,使共享内存成为重要的系统关注点。这种分离让每个角色独立运作,但也可能将外部动作与其授权所依赖的状态和计划割裂开来。  

近期的持久世界研究表明,智能体创建的工件和可执行程序能够超越创建者寿命,通过共享环境被后续智能体复用,这使得计划推导与最终执行之间的时间分离变得具体。考虑一个规划器读取需求r3并推导出计划p(r3)。在执行前,另一智能体提交了修订需求r4。后台传播可能将r4传至执行器而未替换p(r3),导致执行器使用基于旧需求的参数调用工具,却已持有新需求。预订可能使用过时的目的地,履约动作可能运送已取消订单,或部署可能发布过时的构建版本。我们将此失效称为*陈旧计划执行*。该失效并非执行器内存陈旧,而是提供动作参数的推导过程已过时。安装r4并未改变p(r3)源自r3的事实,因此仅状态时效性无法证明待执行计划仍被授权。执行器必须验证计划是否源自其动作所依赖的当前公共记录。我们称此属性为*谱系有效性*。  

一个直接解决方案是强力协调公共状态。每个所有者可广播其当前记录ID并失效那些父项不再匹配的计划,或执行器通过单一强一致性服务比较这些父项。当这种协调成本较低时,这是最简单的安全选择。第3节测量了同步公共状态传输何时进入关键路径。然而,所需检查的范围比全局新鲜内存更窄:预订动作依赖其需求,而非无关的目录记录或其他工作流状态。这产生了系统权衡:是提前协调广泛的共享状态,还是仅在动作即将执行时验证相关记录。  

我们通过三个问题评估这一区别:  
**RQ1**:智能体能否在读取最新状态后仍依据过时计划行动?  
**RQ2**:随着公共状态更频繁变化,哪种方式等待更少:同步每次更新,还是仅在动作前验证?  
**RQ3**:随着共享状态增长,何时仅检查动作相关状态比检查所有共享状态更能降低协调成本?  

**我们的方法**:我们将安全不变量与建立该不变量的机制分离。不变量是受保护动作的精确谱系有效性;系统选择何时及在何种范围检查它。这种分离催生了置于动作边界的**PlanFence**依赖范围协议。每个计划引用用于推导它的精确公共记录,而工具包装器声明哪些记录可能影响待执行动作。在外部调用前,执行器与其所有者验证这些依赖项。变化的输入触发一次重新规划和二次检查;不完整的父链、依赖声明或所有者响应将阻断动作。PlanFence协调公共记录,而非私有提示或隐藏推理。  

图1总结了该动作边界门控过程,从检测变化的依赖、重新规划到最终授权或阻断决策。  
**图1:新鲜事实不保证计划时效**。仅时效性检查可能观察到需求r4,而动作仍使用计划p3。PlanFence验证计划声明的依赖项,检测不匹配,获取r4,并在授权或阻断动作前允许一次重新规划。  

我们的主要贡献总结如下:  
- 我们识别了陈旧计划执行并形式化了谱系有效性,区分了当前执行器状态与当前计划授权。在30个受控实际工作流中,仅时效性的所有者头部检查在所有任务中发出过时动作,而PlanFence在无无效动作的情况下完成了所有任务。  
- 我们为分布式智能体记忆设计并实现了PlanFence。其动作边界门控将计划绑定到精确公共输入,仅验证工具声明的依赖项及其所有者,并在失败前允许一次重新规划。  
- 我们在相同调度下比较了安全协调策略,并绘制了其协调停顿边界。在低更新率下,主动同步停顿较低;随着更新增长,PlanFence避免了重复的无关状态协调。与同等安全的批量全键检查相比,在测试的8-128键环回和AT&T设置中,它降低了停顿和流量。  

## 2 相关工作  

#### 溯源与验证。  
数据溯源记录哪些输入产出了派生对象,而乐观并发控制在提交前验证记录的读取集是否仍为最新。PlanFence将相同基础理念用于不同边界:生成的计划记录其公共输入,而执行器在外部动作前验证它们,而非在数据库事务提交前。与数据库事务不同,LLM生成的计划可能在角色调用、副本和状态刷新中持久存在,远超产生它的读取操作;除非运行时记录精确父项,否则执行器在工具边界没有可验证的读取集。  

#### 分布式一致性。  
强寄存器、主动复制、流行病传播和CRDT提供了暴露当前副本状态的不同方式。其他系统提供一致性限制或应用级选项以权衡延迟与新鲜度。PlanFence不引入新的一致性模型。它指定哪些记录版本必须仍授权待执行动作,并可使用主动传播或动作时所有者查询来确立这一事实。  

#### LLM智能体协调与记忆。  
LLM多智能体系统通过固定或学习的交互结构组织角色协作与通信;MCP和A2A提供工具和智能体交互的接口。智能体记忆研究则强调检索、经验和共享记忆。大多数工作关注智能体应通信、检索或保留什么;持久世界系统还研究超越创建者寿命并获取可执行谱系的工件。SwarmWorld记录内容寻址的父子程序谱系,让后续智能体继承和修改持久程序,并将模型生成的计划作为有界动作队列提交,同时共享世界持续演化。其运行时检查决定每个尝试动作在空间、物质、能量、所有权和权限约束下当前是否合法。此技术谱系支持继承和归因;而PlanFence则使用精确推导谱系来确定待执行动作是否仍由其动作相关公共输入的当前版本授权(由其所有者报告)。  

## 3 动机与问题形式化  
强力协调可保持公共状态最新,但其放置位置决定了通信是否进入动作关键路径。图2测量了随着载荷大小、延迟和丢包变化,一次认证TCP同步的成本。该操作在有利路径上成本低廉,但在每次脏更新后支付此成本可能随着内容增长或网络状况恶化而累积显著延迟。  

**图2:单次同步在有利路径上成本低,但随状态或链路恶化可能变得显著**。在重放链路轨迹下,一次新鲜认证TCP传输的阻塞时间随公共状态大小增长(a),而丢包会放大4 KiB传输的p95,即使中位数保持稳定(b)。117 ms参考值是审计的Qwen3.5角色调用中位时长的10%,而非端到端截止时间。每次更新同步可能在每次脏更新后支付此单位成本;该图未比较完整内存策略。  

执行器无需在动作时重现整个内存系统。它需要足够证据回答三个问题:哪些公共版本产生了此计划?哪些公共项目可能影响此动作?它们所有者当前授权的版本是什么?我们按此顺序引入对应对象,然后陈述动作有效性条件。  

### 3.1 公共状态具有版本  
令A={a1,...,aN}为智能体集合。在分布式智能体内存中,每个智能体可能持有团队公共状态的本地副本。私有草稿本、提示和隐藏推理不是公共记录,位于谱系模型之外。*语义键*x∈X标识跨版本的同一逻辑公共项目,而记录ID标识该项目的一个不可变版本。应用为x分配权威所有者o(x)∈A,其当前授权的记录ID是*头部*H(x)。派生的公共记录保留用于生成它们的精确版本ID。  

图1实例化了这些对象。语义键x_req表示需求,记录r3和r4是具有ID id3和id4的不可变版本。修订后,所有者报告H(x_req)=id4,而计划p3=p(r3)仍引用id3作为其精确父项。安装r4改变了执行器的本地状态,但未重写p3记录的推导过程。  

### 3.2 什么证据必须授权动作?  
**精确推导**:对于受保护动作a,令L(a)为其参数授权的计划根节点。不可变的父链接记录了这些根节点所派生的精确公共版本。  
**声明范围**:工具包装器声明D(a)⊆X,即值可能影响动作的公共键。此声明属于应用程序代码,而非生成文本。  
**权威时效性**:对于每个x∈D(a),执行器询问所有者o(x)其当前授权版本H(x)。从L(a)开始,它还跟踪精确父项直到到达计划使用的x版本;将该记录ID记为F_a(x)。映射F_a是计划的*依赖边界*。动作在记录的验证点谱系有效当且仅当  
Valid(a) ⟺ F_a(x) = H(x), ∀x∈D(a). (1)  

### 3.3 为何每个条件都必要  
公式(1)分离了授权动作所需证据。RQ1询问读取最新状态是否足以授权待执行计划。答案是否定的:新鲜本地需求无法显示哪个需求产生了缓存计划,而计划的精确父项可以。对于陈旧计划,F_a(x_req)=id3而H(x_req)=id4。基于r4重新规划会将边界更改为id4并通过相同检查。  

RQ2询问何时支付所有者头部协调成本:在每次更新后,还是仅在动作即将执行时。系统可以主动分发权威头部,或在动作边界查询它们,但无法从任意本地副本推断当前授权。  

RQ3询问需检查多少状态。声明集D(a)包含动作相关状态,因此D(a)之外的变化不会使动作失效;选择D(a)=X时...

相似文章

计划不持久:为何上下文管理对LLM智能体至关重要

Hugging Face Daily Papers

本文研究了LLM智能体在长时间交互过程中如何因计划信息被从上下文中驱逐而丢失。通过重放配对和压缩压力测试,作者展示了标准智能体不会将计划作为持久状态携带,并提出了衡量计划信号衰减的诊断方法。

跨会话智能体记忆的失效合约

arXiv cs.AI

本文引入了失效合约,作为LLM智能体在跨会话中管理缓存恢复建议的协议,以解决服务器端数据漂移问题,并通过驱逐过时条目来提高令牌效率,同时保持高合规率。

多智能体LLM系统的受控共享内存

arXiv cs.AI

本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。

STALE:LLM智能体能否识别记忆何时失效?

Hugging Face Daily Papers

本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。