可验证记忆:利用局部和全局验证器为大型语言模型智能体学习统一内存管理
摘要
VerMem是一个用于LLM智能体的统一内存管理框架,利用局部和全局验证器结合强化学习,共同控制长期记忆和短期记忆。它在五个基准测试上优于强基线,并改善了效率-性能权衡。
arXiv:2608.03137v1 公告类型:新
摘要:大型语言模型(LLM)智能体必须在长程交互中保留可重用信息、控制有界的活动上下文并恢复早期证据。现有方法通常分别优化长期记忆(LTM)和短期记忆(STM),而统一策略往往主要使用轨迹级反馈进行训练,这为单个记忆决策提供的信用信号较弱。我们提出可验证记忆(VerMem),该框架将LTM、活动上下文和情景历史表示为不同的状态,并通过一个记忆操作策略对它们进行控制。七个原子操作使策略能够添加、修改或软删除LTM条目;将LTM检索到活动上下文;过滤或总结活动上下文;以及恢复选定的情景片段。VerMem通过监督微调初始化,并通过三阶段强化学习课程进行训练。局部验证器对可执行的记忆转换进行评分,全局验证器在任务完成后评估证据一致性和最终记忆一致性。这些分数通过分层信用分配与程序化计算的任务、证据召回、效率和约束信号相结合。验证器仅在训练期间使用。在五个基准测试和两个LLM主干模型上,VerMem在绝大多数报告的指标上取得了最佳结果,并持续优于强记忆基线。在三个交互基准测试的受控在线token预算下,它还在对比方法中实现了最强的效率-性能前沿。代码可在 https://github.com/Sun-SYSU-24/VerMem 获取。
查看缓存全文
缓存时间: 2026/08/05 07:39
# 利用局部与全局验证器学习大语言模型智能体的统一记忆管理 来源:https://arxiv.org/html/2608.03137 孙晓龙¹,王其超²,李航宇³,陈亮¹,∗ ¹ 中山大学,中国广州 ² 南洋理工大学,新加坡 ³ 腾讯,中国深圳 [email protected] [email protected] [email protected] [email protected] ∗通讯作者 ###### 摘要 大语言模型(LLM)智能体在长时程交互过程中必须保留可复用信息、控制有界的活动上下文,并在需要时恢复早期证据。现有方法通常分别优化长期记忆(LTM)和短期记忆(STM),而统一策略往往主要依赖轨迹级反馈进行训练,这无法为单个记忆决策提供细粒度的信用分配。我们提出可验证记忆(VerMem)框架,将LTM、活动上下文和情景历史表示为不同的状态,并通过一个记忆操作策略统一控制它们。七个原子操作使策略能够添加、修订或软删除LTM条目;将LTM检索到活动上下文;过滤或摘要活动上下文;以及恢复选定的情景片段。VerMem通过监督微调初始化,并使用三阶段强化学习课程进行训练。局部验证器对可执行的记忆转换进行评分,全局验证器则在任务完成后评估证据一致性和最终记忆一致性。这些分数与程序化计算的任务、证据召回、效率和约束信号相结合,通过分层信用分配进行训练。验证器仅在训练期间使用。在五个基准和两个LLM基座模型上,VerMem在绝大多数报告的指标上取得了最佳结果,并持续优于强大的记忆基线。在三个交互式基准上受控的在线令牌预算下,它还实现了所比较方法中最强的效率–性能前沿。代码可从https://github.com/Sun-SYSU-24/VerMem 获取。 ## 1 引言 在涉及多步交互、工具使用和复杂推理的长时程任务中,大语言模型(LLM)智能体的性能不仅取决于单步生成,还取决于跨决策保留和使用任务相关信息的能力。先前工作使用智能体记忆(agent memory)来描述智能体在给定时间可以关注和使用的信息(Yu等人,2026 (https://arxiv.org/html/2608.03137#bib.bib28))。这些信息包括存储的过往执行结果以及由交互历史形成的状态表示(Xiong等人,2026 (https://arxiv.org/html/2608.03137#bib.bib23);Goodyear等人,2025 (https://arxiv.org/html/2608.03137#bib.bib4))。智能体记忆通常分为长期记忆和短期记忆(Yu等人,2026 (https://arxiv.org/html/2608.03137#bib.bib28))。长期记忆(LTM)持久存储用户或任务特定的知识,供后续轮次、阶段或任务复用(Jiang等人,2024 (https://arxiv.org/html/2608.03137#bib.bib6);Zhong等人,2024 (https://arxiv.org/html/2608.03137#bib.bib29))。短期记忆(STM)包含当前输入上下文中的信息,支持进行中的推理、动作选择和上下文控制(Wu等人,2025b (https://arxiv.org/html/2608.03137#bib.bib22);Gao等人,2025 (https://arxiv.org/html/2608.03137#bib.bib3))。LTM跨时间保留信息,而STM保持当前推理状态可用。因此,二者的协调对长时程智能体推理至关重要。 现有系统往往只优化这一过程的单一方面。面向STM的方法组织或压缩当前推理状态(Qian等人,2026 (https://arxiv.org/html/2608.03137#bib.bib14);Li等人,2025 (https://arxiv.org/html/2608.03137#bib.bib8)),而面向LTM的方法则构建外部存储以实现持久召回(Zhong等人,2024 (https://arxiv.org/html/2608.03137#bib.bib29);Xu等人,2025 (https://arxiv.org/html/2608.03137#bib.bib24))。然而,存储的信息只有在合适的时机进入活动上下文后才会影响决策,且复用与任务错位的经验可能传播错误(Xiong等人,2026 (https://arxiv.org/html/2608.03137#bib.bib23))。Yu等人(2026 (https://arxiv.org/html/2608.03137#bib.bib28))引入的AgeMem策略将LTM和STM操作放入同一策略中,但其STM动作主要聚焦于检索、过滤和摘要。长时程任务可能还需要在早期观察、工具输出或中间结论离开活动上下文后,将其从情景历史中恢复。该操作不同于检索持久知识,也不同于压缩近期上下文。学习此类行为还引入了第二个困难。Yan等人(2026 (https://arxiv.org/html/2608.03137#bib.bib25))、Zhou等人(2025 (https://arxiv.org/html/2608.03137#bib.bib30))和Yu等人(2026 (https://arxiv.org/html/2608.03137#bib.bib28))使用下游结果或轨迹级反馈来优化记忆决策。这些信号比较完整的轨迹,但无法识别哪个原子转换是有用还是有害的。过程监督和转换级信用分配可改善中间反馈(Setlur等人,2025 (https://arxiv.org/html/2608.03137#bib.bib17);Luo等人,2025 (https://arxiv.org/html/2608.03137#bib.bib10)),而MiroMind团队(2026 (https://arxiv.org/html/2608.03137#bib.bib12))在推理期间结合了局部和全局验证。操作级和轨迹级验证尚未被联合用于训练统一的记忆操作策略。 这些局限给统一且可训练的记忆操作策略带来了三个挑战: (A)异质记忆协调。LTM决定应存储、修订或删除什么;STM决定什么应进入、保留或离开活动上下文。两种记忆类型作用于不同的状态和时间尺度。在共享决策过程中协调它们,同时保持各自的功能边界,仍然很困难。 (B)历史上下文恢复。当前提示只是完整任务历史的一个有预算的视图。早期观察、工具输出和中间结论在子目标变化后可能重新变得相关。在不引入大量无关历史的情况下恢复相关片段并非易事。 (C)多粒度信用分配。记忆操作的效果往往是延迟的,并依赖于后续操作。正确的写入可能只有在之后被检索时才变得有用,而错误的过滤可能导致几步后失败。训练必须在保持与完整任务目标一致的前提下,为具体操作分配信用。 为解决这些挑战,我们提出Verifiable Memory(VerMem),如图1 (https://arxiv.org/html/2608.03137#S3.F1) 所示。VerMem将LTM、活动上下文和情景历史保持为不同的状态,同时通过七个原子工具,由一个记忆操作策略协调LTM维护、STM控制和历史上下文恢复。训练首先采用监督微调(SFT)预热,然后使用三阶段强化学习课程分别针对LTM、STM及二者的联合使用进行优化。局部验证器评估每个已实现的记忆转换,全局验证器评估完整轨迹。两者分别归一化的优势会在每个记忆决策处相加。两个验证器在推理期间均被移除。在五个长时程基准和两个基座模型上,VerMem持续提升任务性能,并实现了更强的效率–性能前沿。 本工作的主要贡献总结如下: - ∙ 我们提出VerMem,一个统一的智能体记忆管理框架。VerMem通过单一记忆操作策略协调LTM维护和STM控制,同时为LTM、活动上下文和情景历史保留不同状态。其原子动作空间还支持情景级上下文选择。 - ∙ 我们引入局部–全局验证器引导的分层信用分配。VerMem从有状态的多步轨迹中构建操作级局部优势和轨迹级全局优势。两个信号在每次记忆决策处结合,使操作质量和最终任务效用共同引导策略更新。 - ∙ 我们在多样的复杂任务上进行系统评估。我们在五个基准上对比强记忆基线,并在受控在线令牌预算下评估其效率–性能权衡。消融实验进一步检验了统一LTM/STM管理、局部和全局信用信号以及多组件奖励设计。 ## 2 相关工作 ### 2.1 长期记忆(LTM) 长期记忆研究关注智能体如何在活动上下文之外保留、组织和复用历史信息。LangChain团队(2025 (https://arxiv.org/html/2608.03137#bib.bib7))将LangMem描述为一组用于记录、搜索和整合持久知识的模块化原语。Zhong等人(2024 (https://arxiv.org/html/2608.03137#bib.bib29))提出MemoryBank,通过持续记忆更新实现长时程召回和用户画像。Chhikara等人(2025 (https://arxiv.org/html/2608.03137#bib.bib2))的Mem0框架从扩展对话中提取、整合和检索显著信息,而Xu等人(2025 (https://arxiv.org/html/2608.03137#bib.bib24))的A-Mem框架通过动态索引、链接和演进来组织记忆。这些系统改进了持久状态的构建,但主要关注信息如何存储和组织。存储的知识只有在适当阶段进入活动上下文后才会影响当前决策。错误或与任务错位的经验在复用时也可能传播错误(Xiong等人,2026 (https://arxiv.org/html/2608.03137#bib.bib23))。这促使我们联合控制持久记忆维护和活动上下文使用,而不是对LTM进行孤立优化。 ### 2.2 短期记忆(STM) 短期记忆研究关注在有界上下文预算下维持当前推理所需的活动上下文。Qian等人(2026 (https://arxiv.org/html/2608.03137#bib.bib14))将推理轨迹和瞬态工具输出组织为紧凑的执行记忆。Li等人(2025 (https://arxiv.org/html/2608.03137#bib.bib8))开发结构化模式,并为长文档理解激活查询相关信息。Wu等人(2025a (https://arxiv.org/html/2608.03137#bib.bib21))定期将不断增长的交互历史压缩为简洁的推理状态,并进一步通过ReSum-GRPO使智能体适应在这些摘要上进行推理。这些方法提高了上下文的可用性,但仍以当前输入、文档或进行中的轨迹为中心。在长时程任务中,有用的证据可能在离开活动上下文后仍保留在情景历史中。单独的检索、过滤和摘要并不完全指定哪个早期情景应返回当前推理状态。VerMem通过从情景历史中选择任务相关片段并将其作为显式STM决策物化到活动上下文,弥补了这一缺口。 ### 2.3 通过验证学习记忆策略 强化学习将记忆管理变为一个可学习的决策过程。Yan等人(2026 (https://arxiv.org/html/2608.03137#bib.bib25))学习结构化更新,Huo等人(2026 (https://arxiv.org/html/2608.03137#bib.bib5))暴露原子记忆操作,Zhou等人(2025 (https://arxiv.org/html/2608.03137#bib.bib30))联合学习整合与推理,Yu等人(2026 (https://arxiv.org/html/2608.03137#bib.bib28))训练统一的LTM/STM策略。这些方法主要使用答案级或轨迹级目标来优化记忆行为。过程监督评估中间推理进展(Setlur等人,2025 (https://arxiv.org/html/2608.03137#bib.bib17)),而Luo等人(2025 (https://arxiv.org/html/2608.03137#bib.bib10))和Peng等人(2026 (https://arxiv.org/html/2608.03137#bib.bib13))为智能体转换或分层决策分配信用。MiroMind团队(2026 (https://arxiv.org/html/2608.03137#bib.bib12))在推理期间应用局部和全局验证。VerMem则使用操作级和轨迹级验证信号来训练记忆操作策略。 ## 3 方法 我们提出可验证记忆(VerMem),一个维护持久LTM、有界活动上下文和情景历史作为不同状态的统一框架。如图1 (https://arxiv.org/html/2608.03137#S3.F1) 所示,一个记忆操作策略协调LTM维护、STM控制和历史上下文恢复。该策略通过SFT初始化,并通过三阶段强化学习课程进行优化。局部验证器提供操作级语义分数,而复合全局分支提供来自程序化组件和全局验证器组件的轨迹级信用。两个验证器在推理期间均被移除。 图1:VerMem概览。左:记忆操作策略协调长期和短期记忆工具,以维护长期记忆和活动上下文。历史上下文恢复为LLM恢复相关的情景历史,LLM的动作和答案被记录供后续步骤使用。右:三阶段课程生成K个有状态轨迹。局部验证器评估可执行的记忆转换,全局验证器在任务完成后评估证据一致性和最终记忆一致性。这些分数被纳入分别归一化的局部和全局优势中;约束成本保持独立。验证器分支仅在训练期间使用。 ### 3.1 问题形式化 统一记忆操作策略形式化。固定任务规范记为q。在记忆决策步骤t,长期记忆Mt、活动上下文Ct和同任务情景历史Ht定义概念状态及其策略可见的序列化形式: s_t = (q, M_t, C_t, H_t), (1) x_t = g(s_t)。 这里,Mt存储供后续步骤或阶段复用的持久信息;Ct是任务求解器可见的有界上下文;Ht保留同任务内观察、任务动作、工具输出、中间结论和记忆决策的有序记录。将Ct与Ht分离,可使信息离开活动上下文而不会从该记录中移除。函数g保留任务规范和当前任务状态,然后在协议使用的8,192令牌策略状态限制内,序列化Mt、Ct和同任务Ht的有界视图。它不会无界地拼接Ht。因此,等式(1)将概念状态与提供给策略的有界输入区分开来。设v_t表示操作类型,ξ_t为结构化参数。生成的完整记忆命令为u_t = (v_t, ξ_t),其中v_t ∈ V ∪ {∅},V表示等式(6)中形式化的七种操作类型。空命令具有空参数。完整命令和记忆转换为 u_t = (v_t, ξ_t), (2)
相似文章
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。
ChronoMem:大型语言模型智能体记忆的版本控制与语义回滚
ChronoMem 为 LLM 智能体记忆引入了一层语义版本控制,支持全量记忆快照、通过混合检索实现的自然语言回滚,以及反事实评估。它是首个面向 LLM 智能体全局记忆回滚的开源系统与基准。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
SuperLocalMemory V3.3: 活体大脑——面向零LLM智能体记忆系统的生物启发式遗忘、认知量化与多通道检索
SuperLocalMemory V3.3 引入了一种面向AI智能体的统一记忆与学习系统,具备生物启发式遗忘、多通道检索和P2P网状协调。该系统在LoCoMo基准测试上达到74.8%的成绩,并具有三流学习、生命周期管理和符合欧盟AI法案的特点。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。