从记忆到技能:基于证据的长期LLM智能体协同进化治理
摘要
MSCE是一种免训练框架,将LLM智能体的经验组织为三个记忆层次,并将其转化为带有证据链接的可复用技能,优于现有的记忆增强和技能增强基线。
arXiv:2607.16621v1 Announce Type: new
摘要:现有的长期LLM智能体记忆系统通常将先前轨迹作为被动上下文检索,而非将其转化为可执行能力。本文提出MSCE,一种免训练的“记忆-技能协同进化”框架,将智能体经验组织为有根据的步骤轨迹、可复用的程序化策略以及声明性环境认知。MSCE将带有正面估计增益的证据支持型L2策略结晶化为可调用技能,这些技能保留证据链接、适用边界、决策指导、验证规则和可靠性估计。它还引入了反射加权值回溯,通过密集的局部自我反思传播稀疏的终端反馈,生成经证据校准的轨迹值以管理记忆与技能进化。在EvoAgentBench和LoCoMo上的实验表明,MSCE显著优于最先进的技能增强和记忆驱动智能体基线,展现出强大的跨领域迁移性和终身进化能力。
查看缓存全文
缓存时间: 2026/07/21 06:43
# 从记忆到技能:面向长周期LLM智能体的证据驱动协同演化治理 来源:https://arxiv.org/html/2607.16621 1\](https://arxiv.org/html/2607.16621#aff1)MemTensor 2\](https://arxiv.org/html/2607.16621#aff2)中国科学技术大学 3\](https://arxiv.org/html/2607.16621#aff3)香港理工大学 4\](https://arxiv.org/html/2607.16621#aff4)福州大学 5\](https://arxiv.org/html/2607.16621#aff5)西安交通大学 杨张 庄国铭 韦文强 郑高阳 谢林栋 谭延超 熊飞宇 杨庆宇 Edward Chung 李智宇 \[[[[zynolo96@outlook\.com (mailto:[email protected]) (2026年7月18日) ###### 摘要 现有的长周期LLM智能体记忆系统通常将过往轨迹检索为被动上下文,而非将其转化为可执行能力。本文提出MSCE——一种无需训练的**记忆-技能协同演化**框架,它将智能体经验组织为带依据的步骤轨迹、可复用的过程化策略以及声明式环境认知。MSCE将具有正向估计增益的、有证据支撑的L2策略结晶为可调用技能,这些技能保留证据链接、适用边界、决策指导、验证规则和可靠性估计。MSCE进一步引入反思加权价值回填机制,通过密集的局部自我反思传播稀疏的终端反馈,生成证据校准的轨迹价值,用于治理记忆和技能演化。在EvoAgentBench和LoCoMo上的实验表明,MSCE显著优于当前最先进的技能增强型和记忆驱动型智能体基线,展现出强大的跨领域迁移能力和终身演化能力。 ## 1 引言 大语言模型(LLM)智能体越来越多地被部署到涉及工具使用、文件编辑、应用程序交互和工作流协调的长周期、多步骤、用户特定任务中。在此类场景下,长期记忆对于克服有限的上下文窗口至关重要,它能确保智能体保持连贯性、个性化行为并跨会话复用经验。现有的记忆机制通常存储两类内容:**事实记忆**(如原始交互、用户事实和压缩上下文\[zhou2023recurrentgpt, xu2025mem, chen2025compress, kang2025memory\])或**经验记忆**(如反思、推理轨迹和任务摘要\[liu2023think, shinn2023reflexion, zhao2024expel, zhang2025memgen\])。这些记忆常常以被动上下文的形式被复用,而非转化为可操作的知识。例如,重复的插件安装轨迹可能揭示清单检查、依赖解析、注册、重载和可用性检查等步骤,但大多数系统仍然检索这些轨迹并要求智能体再次对其推理。此外,在反复探索同一仓库后,智能体可能仍然会重新列出目录以定位测试文件、配置文件或构建脚本,导致过多的Token消耗。 技能提供了一种更具可执行性的可复用知识形式:技能不是仅仅提醒智能体过去的观察,而是提供一个可操作的流程来指导未来的行动\[anthropic\_agent\_skills\_2025\]。然而,将智能体轨迹转化为可复用的技能十分困难。原始轨迹包含失败的尝试、盲目探索以及环境特定的产物,而终端反馈通常是稀疏且延迟的,使得步骤级别的信用分配不确定。此外,一个可复用的技能不仅需要成功的流程,还需要触发条件、适用边界、验证标准和生命周期维护。因此,直接提炼的技能可能过拟合原始轨迹,并在不恰当的上下文中被调用。 为解决这些挑战,我们提出MSCE——一个无需训练的**记忆-技能协同演化**框架,它从受治理的记忆中提升技能,而非直接从嘈杂轨迹中提取。MSCE将经验组织为三个记忆层级: - **L1轨迹记忆**:存储有依据的步骤级证据。 - **L2策略记忆**:从跨剧集轨迹中归纳出重复出现的过程模式。 - **L3环境认知记忆**:抽象关于环境结构和约束的声明式知识。 这一层级将证据、过程和环境知识分离,将嘈杂的交互历史转化为可治理的抽象层,使其能够被验证、修订并作为可复用技能部署。在此受治理记忆之上,MSCE将有用且有证据支撑的L2策略结晶为技能。当一个策略保留支撑证据、表现出正向估计增益并且与其当前触发条件、过程和适用边界一致时,它便有资格成为技能。生成的技能保留证据锚点、验证规则以及可靠性驱动的生命周期。 为了提供支撑这一治理的价值信号,MSCE引入了**反思加权价值回填**,通过局部自我反思将稀疏的终端反馈传播到有依据的轨迹上。生成的证据校准轨迹价值作为统一信号,用于检索、策略归纳、环境认知抽象、技能提升及后续修订。 总结而言,我们的主要贡献包括: - **框架**:我们提出MSCE,一种无需训练的记忆-技能协同演化框架,将长周期智能体经验组织为有依据的轨迹、过程化策略和声明式环境认知。 - **方法**:我们设计了一种受治理的记忆到技能提升机制,仅将受支持的、正增益且稳定的L2策略结晶为可调用技能。我们进一步引入反思加权价值回填,将稀疏终端反馈与密集自我反思耦合,生成证据校准的轨迹价值,用于联合更新记忆和技能。 - **实验**:在EvoAgentBench和LoCoMo上的综合评估表明,MSCE达到了最先进的性能。进一步的分析验证了其在处理长周期和多领域环境时的有效性,展示了正向的跨领域迁移和终身演化增益。 ## 2 相关工作 ### 2.1 LLM智能体的记忆 根据 wang2026memex 的分类,我们将现有LLM智能体的长期记忆系统大致分为两个范式:事实记忆和经验记忆。 **事实记忆**侧重于检索原始交互日志或观察以保持一致性。该范式中的方法增强检索机制\[chen2025compress, long2025seeing\]或利用知识组织,将记忆结构化为互联网络\[xu2025mem\]、神经生物学启发的图\[gutierrez2024hipporag, chhikara2025mem0\]或层级存储\[sun2026h\]。虽然它们在回忆过去事件\[zhou2023recurrentgpt, zhou2025memento\]方面有效,但常常用片段化噪声淹没上下文窗口,且缺乏更高层次的抽象。 为解决此问题,**经验记忆**总结过去的轨迹以指导未来推理。TiM\[liu2023think\]通过存储不断演化的思维链或反思,使智能体能够从试错中学习。架构驱动的框架引入了类操作系统系统\[kang2025memory, hu2026evermemos\]和先进的抽象机制\[wang2026memex, zhangg, zhang2025memgen, ouyang2025reasoningbank\]来动态管理上下文并提取可复用策略。 尽管有这些进展,大多数检索到的记忆仍然是被动上下文,需要智能体对其再次推理。MSCE 的不同之处在于将记忆视为一个受治理的基础,从中归纳出过程化策略和可部署的技能。 ### 2.2 LLM智能体的技能 与通用经验摘要不同,技能是结构化的、自包含的包,编码了可复用的流程,使智能体能够直接执行复杂工作流。当前的技能获取方法通常遵循两种范式。 **基于外部知识的技能**依赖于人类专业知识或精心策划的数据集\[chen2026cua, liang2026skillnet, jiao2026agentic\]。例如,CUA-Skill参数化人类计算机使用知识,而SkillNet构建大规模技能网络。然而,获取高质量专业知识的成本高昂,并且这些技能难以适应特定用户、开放式的环境。 **基于交互轨迹的技能**通过提炼智能体自身的试错经验实现自主适应\[wangvoyager, wang2025agent, qiu2026autorefine, alzubi2026evoskill, yang2026autoskill, zhang2026skillflow\]。例如,SkillFlow和EvoSkill引入了持续维护机制,从执行轨迹中提取并精炼技能。此外,强化学习方法\[xia2026skillrl, wang2025reinforcement\]如SkillRL和SAGE利用环境反馈优化技能。 尽管有这些努力,直接从未治理的、固有噪声的原始轨迹中提炼技能往往会产生脆弱且过于具体的流程。MSCE 在技能部署之前插入了一个中间的证据保留记忆层级:L1轨迹提供锚点,L2策略聚合跨剧集流程,L3环境认知提供声明式上下文。同期工作如MemSkill\[zhang2026memskill\]和ProcMEM\[mi2026procmem\]通过将记忆操作重新定义为技能或将技能池视为过程性记忆来整合记忆和技能。相比之下,MSCE 将三级记忆和可执行技能分离,并通过证据锚点和价值信号将它们联系起来。这种设计将记忆-技能整合转化为一个受治理的提升问题:什么可以成为技能,何时应用,以及如何修订或淘汰。 我们进一步在附录7.1 (https://arxiv.org/html/2607.16621#S7.SS1) 中讨论关于自我演化LLM智能体的相关工作。 ## 3 背景 在本文中,我们将LLM智能体与长周期环境的交互形式化为一个有序的任务序列。**任务**指由用户查询 qq 发起的面向用户目标,而**剧集**指MSCE使用的反馈和更新单元。在常见的单轮情况下,一个任务包含一个剧集;在多轮设置中,由于后续请求或纠正,一个任务可能包含多个剧集。 我们考虑有序剧集序列 E=\{E1,E2,...,En\}\mathcal\{E\}=\{E\_\{1\},E\_\{2\},\ldots,E\_\{n\}\} 。在剧集 EiE\_\{i\} 期间,智能体生成 HiH\_\{i\} 个步骤轨迹 Fi=\{fi,1,fi,2,...,fi,Hi\}F\_\{i\}=\{f\_\{i,1\},f\_\{i,2\},\ldots,f\_\{i,H\_\{i\}\}\} 。在每个步骤 tt ,轨迹表示为 (si,t,ai,t,oi,t,ρi,t)(s\_\{i,t\},a\_\{i,t\},o\_\{i,t\},\rho\_\{i,t\}) ,其中 si,ts\_\{i,t\} 表示语义上下文, ai,ta\_\{i,t\} 是原始动作, oi,to\_\{i,t\} 是环境返回的观察, ρi,t\rho\_\{i,t\} 是智能体的自我反思。 在此环境中,智能体可以利用已结晶的技能库 K\mathcal\{K\} 。智能体不是每一步都从头探索,而是监控当前状态 si,ts\_\{i,t\} 是否满足 K\mathcal\{K\} 中任何技能的触发条件。如果检索到相关技能 k=μ(si,t,K)k=\mu(s\_\{i,t\},\mathcal\{K\}) ,则将其注入上下文以指导动作生成: ai,t=πLLM(⋅∣si,t,k)a\_\{i,t\}=\pi\_\{\mathrm\{LLM\}\}(\cdot\mid s\_\{i,t\},k) 。否则,策略回退为仅基于当前状态生成动作。 剧集 EiE\_\{i\} 终止后,系统接收一个终端反馈信号。该信号可以是环境验证器的数值奖励或用户的文本反馈。对于文本反馈,我们使用附录8.3 (https://arxiv.org/html/2607.16621#S8.SS3) 中的奖励量化机制将其转换为标量终端反馈 RiR\_\{i\} 。 主要目标是最大化累积剧集级反馈 ∑i=1nRi\sum\_\{i=1\}^\{n\}R\_\{i\} 。在实践中, RiR\_\{i\} 可能反映任务成功度、用户满意度、过程质量、安全性或效率。 ## 4 方法 ### 4.1 概述 参见图注:图1:MSCE 总体结构,包含受治理的记忆、技能结晶和双信号价值回填。 MSCE 的总体结构如图1 (https://arxiv.org/html/2607.16621#S4.F1) 所示。它维护一个记忆层级 M=(M(1),M(2),M(3))\mathcal\{M\}=(\mathcal\{M\}^\{(1)\},\mathcal\{M\}^\{(2)\},\mathcal\{M\}^\{(3)\}) ,其中 L1轨迹保存可审计的证据,L2策略抽象出可修订的流程,L3环境认知存储声明式环境知识。技能库 K\mathcal\{K\} 位于此记忆层级的下游,提供经过验证的可调用流程。这种分离确保技能可追溯至证据,同时防止轨迹、策略、环境事实和可调用动作合并到一个不受控制的池中。 MSCE 将具有正估计增益且有证据支撑的L2策略结晶为技能,并利用反思加权价值回填从终端反馈更新记忆和技能。 ### 4.2 三级记忆 #### L1 轨迹记忆 L1 存储交互过程中收集的有依据的决策单元: fi,t(1)=(si,t,ai,t,oi,t,ρi,t,V(fi,t(1)))f\_\{i,t\}^\{(1)\}=(s\_\{i,t\},a\_\{i,t\},o\_\{i,t\},\rho\_\{i,t\},V(f\_\{i,t\}^\{(1)\})) ,其中 si,ts\_\{i,t\}, ai,ta\_\{i,t\}, oi,to\_\{i,t\} 和 ρi,t\rho\_\{i,t\} 分别表示步骤 tt 的语义状态、动作、观察和内部反思。轨迹价值 V(fi,t(1))V(f\_\{i,t\}^\{(1)\}) 初始化为不可用,并在终端反馈到达后填充,如第4.4 (https://arxiv.org/html/2607.16621#S4.SS4) 节所述。 L1 是 MSCE 的证据层:更高级的记忆和技能必须维护与其支撑轨迹的链接,以便归纳出的流程可以追溯到具体交互。为了限制存储空间并降低隐私风险,MSCE 不会持久化无界的原始观察。相反,L1 存储标准化的证据:截断的状态文本、智能体动作文本、结构化工具调用元数据以及限制长度的工具输入和输出。更高级的记忆存储证据标识符,而不是复制原始观察。 #### L2 策略记忆 L2 存储从重复出现的轨迹证据中归纳出的可复用策略: f(2)=(φ,π,κ,B,{f(1)})f^\{(2)\}=(\phi,\pi,\kappa,\mathcal\{B\},\{f^\{(1)\}\}) ,其中 φ\phi 是触发条件, π\pi 是自然语言流程, κ\kappa 指定验证或回退标准, B\mathcal\{B\} 记录适用边界, {f(1)}\{f^\{(1)\}\} 是支撑的L1证据集。 **策略提取**:当一条有价值的 L1 轨迹 fi,t(1)f\_\{i,t\}^\{(1)\} 可用时,MSCE 首先检查其步骤价值是否满足 V(fi,t(1))≥vminV(f\_\{i,t\}^\{(1)\})\geq v\_\{\min\} ,其中 vminv\_\{\min\} 表示策略提取阈值。符合条件的轨迹通过与现有L2策略进行嵌入相似度以及结构化证据(如领域标签、工具类型和标准化错误签名)的匹配。匹配到的轨迹会更新相应策略。如果没有匹配的策略,则将该轨迹放入一个以确定性模式签名为键的候选池中。只有当同一签名桶中包含至少 nminn\_\{\min\} 个不同剧集的证据时,才通过提示 Πpolicy\Pi\_\{\mathrm\{policy\}\} 归纳一个新的L2策略。 **策略增益**:对于每个被触及的策略,MSCE 计算其在步骤级价值上的启发式效用增益。设 SwithS\_\{\mathrm\{with\}\} 为与该策略链接的轨迹, SwithoutS\_\{\mathrm\{without\}\} 为同一评估池中的其他轨迹。增益定义为: G(f(2))=Vˉwith−Vˉblend(Swithout)G(f^\{(2)\})=\bar\{V\}\_\{\mathrm\{with\}\}-\bar\{V\}\_\{\mathrm\{blend\}\}(S\_\{\mathrm\{without\}\}) (1)。当 |Swith|≥3|S\_\{\mathrm\{with\}\}|\geq 3 时, Vˉwith\bar\{V\}\_\{\mathrm\{with\}\} 是 V(f)V(f) 的软max加权均值;否则回退为算术均值。
相似文章
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
从存储到经验:大语言模型智能体记忆机制演进综述
本综述论文提出了一种大语言模型(LLM)智能体记忆机制的演进框架,将其发展划分为三个阶段:存储、反思和经验。文章分析了长程一致性和持续学习等核心驱动力,旨在为下一代智能体的设计提供指导原则。
SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
管理LLM智能体中的程序性记忆:控制、适应与评估
介绍了AFTER,一个包含382个企业任务的基准,用于评估LLM智能体中的程序性记忆,表明技能迁移能提升跨任务、角色和模型骨干的性能,部分技能广泛泛化,而另一些则专业化。