多智能体LLM系统的受控共享内存
摘要
本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。
arXiv:2606.24535v1 公告类型:新
摘要:多智能体LLM环境需要鲁棒的共享知识管理机制。本文形式化了舰队内存问题,并识别了四种基础故障模式:未授权泄漏、过时传播、矛盾持久化和溯源崩溃。为解决这些问题,我们定义了明确的系统级原语:范围检索、时间替代、溯源追踪和策略驱动的内存传播。这些原语在MemClaw(一个生产级多租户内存服务)中实现,并通过ArgusFleet(一个可复现的测试框架,测试四个治理维度)进行评估。本研究并非基线比较,而是测量一个实际生产服务,强调真实世界的架构洞察和负面结果。关键评估结果:溯源:成功重建了100%的四层推导链,且每跳延迟低于一秒,作者身份正确。传播:展示了高舰队内部可见性,且零跨舰队泄漏。在强写模式下,写入到可见的延迟优化为单次搜索往返。发现的生产架构问题:不对称范围执行:租户隔离有效,但子租户范围最初在直接通过ID获取代理作用域凭证时被绕过(研究期间已披露并修复)。管道排序冲突:虽然矛盾替代适用于已接受的写入,同步近重复门可能会在异步矛盾检测器能够评估之前过早拒绝矛盾的写入。结论:仅靠长上下文检索不足以支持生产级多智能体内存。受控共享内存需要明确的系统级抽象,而实际评估对于暴露仅靠设计无法发现的执行和管道排序失败至关重要。
查看缓存全文
缓存时间: 2026/06/24 07:48
# 多智能体LLM系统的受控共享内存 来源:https://arxiv.org/html/2606.24535 Yanki Margalit¹,Nurit Cohen-Inger²,Erni Avram¹,Ran Taig¹,Oded Margalit² ¹Caura.ai ²本-古里安大学计算机科学与信息系 ###### 摘要 AI 内存系统正逐渐超越孤立的聊天机器人历史,转向由协作智能体集群所使用的共享状态。在这种设定下,内存不再仅仅是一个检索问题:它演变为一个涉及范围化访问、时间正确性、来源追溯、同步以及策略控制传播的受控分布式系统问题。我们为多智能体 LLM 环境中的受控共享内存引入了一种系统架构。该架构将集群内存问题形式化,识别出四种失效模式——未授权泄露、陈旧传播、矛盾持久化和溯源崩塌——并定义了范围化检索、时间替代、来源追踪和策略控制内存传播的原语。我们在 MemClaw(一个生产级多租户内存服务)中实例化了这些原语,并使用 ArgusFleet(一个可复现的测试工具,通过实时 REST API 从四个治理维度进行测试)对其进行评估。我们的评估是对一个生产级服务的测量,而非与基线对比,其负面结果对贡献至关重要。来源追溯是最清晰的正面结果:所有 50 条深度为四的衍生链都能以每跳亚秒级的延迟正确重建写入者身份。传播在可测量的范围内是正确的,具有高集群内可见性且未观察到跨集群泄露;对单个事实的紧密轮询显示,在强写入模式下,从写入到可见的延迟实际上等同于一次搜索往返时间,而非粗略批处理探测计划所暗示的数十秒延迟。实时评估还暴露了两个与生产相关的架构问题。首先,作用域执行最初在不同的 API 路径上不对称:租户隔离有效,但对智能体作用域的凭证通过直接 GET-by-id 执行时,子租户作用域并未强制执行;该漏洞在研究期间被披露并修复。其次,当冲突写入被接纳时,矛盾替代机制有效,但同步的近似重复门控可能在异步矛盾检测器观察到之前就拒绝了冲突写入。这些发现支持了核心主张:仅靠长上下文检索不足以满足生产级多智能体内存的需求:受控共享内存需要明确的系统级抽象,并且必须通过实时评估才能暴露纯设计方法所遗漏的执行和管道排序失效问题。 ## 1 引言  图 1:系统概述。协作智能体集群通过 MemClaw 的 REST API 向受控共享内存写入和读取数据。MemClaw 暴露了四个治理维度——范围、时间、来源和传播——分别对应谁可以读取内存、哪个版本是当前版本、内存来自何处以及它如何在智能体边界间移动。ArgusFleet 使用每个维度一个实验来探测相同的 API 表面:泄露探针作用域执行,矛盾探针时间替代,来源追溯遍历衍生链,传播测量授权可见性和跨集群泄露。陈旧传播通过矛盾替代(其中过时的行被标记为非活跃)和传播延迟(新写入的事实被轮询直到对授权读取者可见)来联合评估。 大型语言模型系统正从孤立的助手迅速演变为交互式智能体集群。企业副驾、工作流编排器、客户支持系统、研究智能体和自动化流水线越来越依赖持久化内存来跨任务和时间协调行为。然而,大多数现有内存系统都是围绕单智能体抽象设计的——一个用户、一次对话、一个检索流、一个上下文窗口——这一假设在集群级部署下会失效。当多个智能体通过共享内存交互时,会出现单智能体设置中不存在的新的正确性和治理需求。系统必须回答:谁被允许检索哪段内存?当两个智能体意见不一致时如何解决冲突事实?知识如何安全地在智能体边界间传播?每个检索到的内存是否能追溯到其写入者?以及当底层状态变化时,陈旧内存如何失效?这些问题并非检索质量问题。它们是披着检索外衣的分布式系统和数据库一致性问题。 当前的 AI 内存系统主要优化继承自单智能体世界的属性:检索相关性、会话回忆、长上下文压缩和语义相似性。生产级多智能体部署需要一个额外的层:范围化可见性、策略执行、时间正确性、同步语义和来源保证。我们认为,AI 内存正因此从上下文窗口问题演变为一个受控分布式内存问题,并且这种转变值得投入与历史上用于数据库、事件溯源和同步基础设施相同的系统级关注。本文在此框架下介绍了一种受控共享内存的系统架构,并呈现了在集群规模部署的参考实现 MemClaw。我们还介绍了 ArgusFleet,一个评估工具,允许针对实时生产服务对由此产生的原语进行实证测量。 ### 1.1 贡献 本文做出三项贡献。首先,我们形式化了多智能体 LLM 系统的集群内存问题,将共享内存建模为具有范围、来源和时间替代的受控操作状态。我们识别出四种由此产生的失效模式:未授权泄露、陈旧传播、矛盾持久化和溯源崩塌。其次,我们提出了一种受控共享内存的架构,以范围化检索、时间矛盾解决、来源追踪和策略控制传播为中心。我们在 MemClaw(一个生产级多租户内存服务)中实例化了该架构,并介绍了 ArgusFleet(一个可复现的工具,通过实时 REST API 探测这些原语)。第三,我们报告了使用 ArgusFleet 对 MemClaw 进行的一项实时服务测量。结果显示完整的来源重建和正确的传播(在可测量范围内),但也暴露了两个与生产相关的问题:一个已修复的 `GET`-by-id 子租户范围漏洞,以及一个同步去重可能抢占异步矛盾检测的管道排序交互。 ## 2 背景及相关工作 ### 2.1 长上下文检索 长上下文和检索增强方法改善了模型能访问的相关历史信息量[10, 9]。但它们主要优化的是孤立交互内的召回,而非治理。更大的上下文窗口本身并不提供范围化访问、时间一致性、来源或同步;因此,多智能体部署需要的内存系统不仅要回答“模型能否检索到这段信息”,还要回答“这个智能体是否应该看到这个版本”。 ### 2.2 智能体内存系统 近期的一系列智能体内存架构——包括 MemGPT 及其继任者 Letta[13]、Mem0[1]、Zep[14]、LangMem[8]、A-MEM[22] 以及 AutoGen[21] 的内存子系统——将内存视为一个独立组件,位于 LLM 之上。大多数假设在追加型存储上进行单智能体检索,访问基本不受约束,来源语义弱,时间分辨率有限。这些假设对于单用户与单助手进行聊天式交互是合理的;但在多智能体共享内存工作负载下,不同智能体具有不同可见性、不同写入权限和不同推理窗口,这些假设就变得有问题了。 第二个非常近期的工作方向明确转向*共享*多智能体内存,是与我们的设定最接近的邻居。G-Memory[23] 将多智能体内存形式化为一个三层交互/查询/洞察图,并像我们一样论证单智能体内存无法转移到多智能体系统;MIRIX[20] 在类型化存储上组织多智能体内存;Collaborative Memory[15] 在共享多用户存储上增加了*动态访问控制*和不可变来源。这些系统表明,共享内存、治理和来源是一个活跃的关注点——但都没有将时间矛盾解决和替代视为一等内存操作,也没有报告针对实时服务的执行测量。我们的贡献是将所有五个组件(A, M, G, P, T)统一在一个形式主义下,将时间替代(T)作为先前共享内存工作隐含保留的元素,并提供一个对运行系统进行每个维度测试的实证工具。 ### 2.3 分布式系统与共享状态 一旦内存真正在智能体间共享,其操作关注点就与传统的分布式系统相呼应:同步、一致性、访问治理、时间排序、事件传播和可审计性。生产级 AI 内存系统因此越来越像分布式数据库[5, 2]、事件溯源和弱连接复制存储[18, 17]、同步层[7] 和治理中间件[16, 6]——而不是智能体内存工作流起源的检索索引。这表明内存基础设施可能成为未来 AI 架构的基础系统层,而为分布式状态开发的方法和原语是推理它的正确词汇。 ### 2.4 内存治理、安全与隐私 一个平行且同样近期的工作将智能体内存视为安全与隐私面,而非检索索引。MEXTRA[19] 表明,智能体的内存模块是一个具体可提取的攻击面:仅凭精心设计的查询就能在黑盒设置中恢复私密的用户-智能体交互,这恰恰激励了我们形式化的范围化检索保证。在执行方面,CaMeL[4] 将能力和来源元数据附加到值上,并在工具调用时执行策略,而 Fides[3] 提供了一个具有机密性和完整性标签的形式化信息流控制模型,以及一个确定性地执行该模型的规划器。对于传播问题——内存是否*应该*跨智能体边界——典型的框架是语境完整性:ConfAIde[12] 表明,有能力的 LLM 会在人类会隐瞒的上下文中泄露信息,将访问重新定义为适当流动的问题,而非静态权限的问题。我们的未授权泄露发现(§9.1)是该文献研究的经典“混淆副手”问题的一个实例:一个读取处理器解析了调用者身份但随后忽略了它。我们采用这些作为 G 和 P 的治理与来源词汇,补充上述分布式系统词汇用于 M 和 T。 最后,我们的评估框架也与近期将 LLM 评估本身视为多智能体过程的工作相关。PeerRank 通过 LLM 之间基于网络、受控偏见的同行评审来评估模型[11]。我们使用 ArgusFleet 是互补的:它不是评估模型输出,而是评估多智能体系统赖以维持持久共享状态的受控内存底层平台。 ## 3 集群内存问题 现代 AI 部署越来越多地不是由单个助手组成,而是由在共享持久状态上运行的专门智能体集群构成。一个客户支持智能体可能更新用户的计费记录,这随后会影响规划智能体的日程、分析智能体的仪表盘、工作流编排器的路由逻辑,以及下游合规系统的审计跟踪。一个研究智能体可能发现一个结果,而合成智能体、验证智能体、报告系统和自主工作流都需要在数小时或数天后消费它。在这些环境中,内存不再是“对话历史”;它是共享的操作状态,它必须支持的正确性故事与共享存储子系统有更多共同点,而非检索索引。 这种转变改变了问题的性质。传统的 LLM 内存架构优化语义召回、对话连续性、长上下文检索和摘要质量。当一个智能体在一个对话流中与一个用户交互时,这些优化是足够的。但当许多智能体写入共享内存、不同角色具有不同可见性、事实随时间演变、以及正确性在操作层面而非仅仅叙述层面重要时,它们就会失效。在集群级工作负载下,内存子系统必须回答:哪些智能体被允许检索哪些内存?当两个智能体写入矛盾事实时会发生什么?陈旧内存如何被替代?每个检索到的内存能否追踪到其来源?以及知识如何安全地在智能体边界间传播?这些是分布式系统问题,而非检索问题。 > *AI 内存正从上下文窗口问题演变为一个分布式系统问题。* 这种转变引入了一系列新的需求——治理、时间正确性、同步、来源、范围化可见性和策略感知检索——这是单智能体内存工作流未涉及的。我们将满足这些需求的系统称为**集群内存系统**。 ### 3.1 集群内存系统 我们将集群内存系统定义为:**F = (A, M, G, P, T)**,其中: - **A** 代表一组交互的智能体, - **M** 是一个共享内存底层平台, - **G** 是一个治理和策略层, - **P** 代表来源元数据, - **T** 定义了时间排序和替代语义。 与单智能体会话内存不同,集群内存系统必须维护由多个自主执行者随时间进行的交互式读写操作的正确性。这引入了类似于以下领域的挑战: - 分布式一致性 - 访问控制 - 同步 - 事件溯源 - 状态解析 核心挑战不再仅仅是检索语义相关的信息;而是维护操作上正确的共享状态。 ### 3.2 内存操作 一次内存写入操作定义为:**w_i = (a_i, c_i, s_i, t_i, p_i)**,其中: - **a_i** 是写入智能体, - **c_i** 是内存内容, - **s_i** 定义了可见性作用域, - **t_i** 是逻辑时间戳, - **p_i** 是可选的上层写入指针(用于来源追踪)。
相似文章
Σ-Mem:面向基于LLM的多智能体系统的在线可靠性记忆
本文介绍了Σ-Mem,一种用于基于LLM的多智能体系统的在线可靠性记忆,它跟踪同伴的历史能力表现及同伴之间的关系,通过谱界实现稳定自适应,并通过残差引导、路由和加权投票来改善协调性。
基于文件系统的LLM Agent记忆:组织、演化与可持续性
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
智能体LLM系统的共享选择性持久记忆
本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。
GateMem:多主体共享记忆代理中的记忆治理基准评测
GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。
SafeHarbor:面向LLM代理安全的分层记忆增强护栏
SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。