从被动检索到主动记忆导航:学习将记忆作为结构化动作空间使用

arXiv cs.AI 论文

摘要

NapMem是一个框架,将长期用户记忆视为结构化动作空间而非被动检索,通过多粒度记忆金字塔和强化学习训练代理进行记忆导航。实验表明,在记忆密集型任务上表现有竞争力。

arXiv:2607.05794v1 公告类型: 新 摘要:长期用户记忆对于个性化对话代理至关重要,然而许多记忆系统仍然通过被动检索接口暴露记忆,使得模型成为预选证据的消费者。我们介绍NapMem,一个学习将长期用户记忆作为结构化动作空间而非被动检索上下文使用的框架。NapMem将用户历史组织成一个链接的多粒度记忆金字塔,其中原始对话、类型化记忆记录、主题轨迹和用户档案通过来源关系连接,并通过记忆工具暴露这些层级。代理被训练根据查询和中间证据选择记忆,使其能够在回答前检查不同的记忆粒度。在PersonaMem-v2、LongMemEval和LoCoMo上的实验表明,使用记忆工具强化学习训练的NapMem代理在多样的记忆密集型任务中具有竞争力,而在非记忆任务上的评估表明,学习到的策略大致保留了通用推理和工具使用能力。额外分析考察了存储、推理成本、工具使用行为以及导航、记忆粒度和RL训练的消融实验。我们的结果表明,长期用户记忆受益于将结构化存储与学习到的适当粒度记忆使用策略相结合。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:38

# 从被动检索到主动记忆导航:学习将记忆作为结构化动作空间使用 来源:https://arxiv.org/html/2607.05794 00footnotetext:\*工作期间在阿里巴巴实习。†\{\\dagger\}通讯作者。\\correspondingauthor wangwj1@shanghaitech\.edu\.cn, zhoumengyu\.zmy@alibaba\-inc\.com 孙宇涛\*浙江大学 刘一豪\*北京大学 周梦雨†\{\\dagger\}通义大模型应用团队,阿里巴巴 乔嘉怡\*新加坡国立大学 马璐 通义大模型应用团队,阿里巴巴 唐恺 通义大模型应用团队,阿里巴巴 王雯洁†\{\\dagger\}上海科技大学 蒋晓曦 通义大模型应用团队,阿里巴巴 蒋冠军 通义大模型应用团队,阿里巴巴 ###### 摘要 长期用户记忆对于个性化对话智能体至关重要,然而许多记忆系统仍通过被动检索接口暴露记忆,使模型成为预先选择证据的消费者。我们提出 NapMem,一个学习将长期用户记忆作为结构化动作空间(而非被动检索的上下文)来使用的框架。NapMem 将用户历史组织成一个链接的多粒度记忆金字塔,其中原始对话、类型化记忆记录、主题轨迹和用户画像通过溯源关系相连,并通过记忆工具暴露这些层级。智能体被训练为根据查询和中间证据选择记忆,允许在回答之前检查不同粒度的记忆。在 PersonaMem-v2、LongMemEval 和 LoCoMo 上的实验表明,使用记忆工具强化学习训练的 NapMem 智能体在各种记忆密集型任务中具有竞争力,而对非记忆任务的评估表明,学到的策略在很大程度上保留了通用推理和工具使用能力。额外的分析考察了存储、推理成本、工具使用行为以及导航、记忆粒度和 RL 训练的消融实验。我们的结果表明,长期用户记忆受益于将结构化存储与学习到的按适当粒度使用记忆的策略相结合。

## 1 引言

参见图注 图 1:主动记忆导航的激励示例。被动检索只给智能体提供部分证据,而 NapMem 将长期用户记忆暴露为动作接口,使智能体能够在回答前搜索足够证据。

随着大型语言模型(LLM)智能体被部署在个人助理、教育、工作生产力以及其他长期运行的交互场景中,它们被期望在会话之间保持连续性和个性化,这要求智能体建立对用户的持久理解。因此,长期用户记忆正成为个性化对话智能体的关键组成部分(hu2025memory;packer2024memgptllmsoperatingsystems;xu2026toward)。然而,构建有效的用户记忆系统具有挑战性,因为用户信息是多方面的,且未来的查询对记忆有异质需求(zhong2023memorybankenhancinglargelanguage)。不同的查询可能需要不同类型的用户记忆,这使得固定的记忆表示或访问策略难以泛化到未来的交互中。

现有工作从两个方向改进用户记忆:记忆构建和记忆检索。在构建方面,最近的系统通过设计更细粒度的记忆类别、引入向量、图、混合或层级存储结构,以及使用基于智能体的方法来管理记忆条目,从而构建更丰富的记忆基础设施(chhikara2025mem0buildingproductionreadyai;rasmussen2025zeptemporalknowledgegraph;li2025memosoperatingmemoryaugmentedgeneration;kang2025memoryosaiagent)。在检索方面,另一类工作通过引入反射式检索、个性化检索查询或优化检索重排序,使记忆访问更具自适应性(tan2025prospect;jiang2025deepretrieval;zhang2026personalize)。然而,这些方法主要将记忆访问视为系统级的检索功能或预先设计的管道,限制了智能体对如何使用记忆的控制。

我们认为,长期用户记忆的使用应从系统级被动检索转向智能体原生记忆导航。如图 1(https://arxiv.org/html/2607.05794#S1.F1)所示,被动检索将不同的记忆存储结构简化为预先选择的上下文并传递给智能体,限制了智能体在检索到的上下文不完整时检查额外证据的能力。相比之下,主动记忆导航将长期用户记忆形式化为结构化动作空间,并为智能体配备记忆工具,使其能够决定是否需要记忆、咨询哪个抽象层级以及已获取的证据是否足够。

我们用 NapMem(在金字塔记忆上导航)实例化了这一观点,这是一个训练智能体在结构化动作空间中导航记忆的框架。具体来说,NapMem 首先将用户交互历史组织成多粒度记忆金字塔。如图 2(https://arxiv.org/html/2607.05794#S1.F2)所示,金字塔包括用于证据级验证的原始对话、用于紧凑事实和偏好的类型化记忆记录、用于跨会话聚合的主题轨迹以及用于稳定用户级信息的用户画像。这些层级通过溯源关系相连,使记忆库成为不同用户理解层次的可导航接口。为了实现对此接口的导航,NapMem 通过针对不同记忆粒度的工具暴露记忆访问。然后,智能体通过强化学习训练,根据查询和到目前为止收集到的证据使用这些工具。这样,记忆使用成为智能体决策过程中一个显式且可优化的部分:智能体可以从广泛的摘要开始,深入到特定证据,或在收集到足够信息后停止。

参见图注 图 2:NapMem 概览。智能体通过记忆工具主动导航多粒度长期记忆金字塔,选择合适的抽象层级,并根据中间证据细化动作。

我们在六个基准上评估 NapMem,涵盖长期用户记忆任务和非记忆任务。在三个记忆密集型基准上,NapMem 在多样化的用户记忆需求(包括个性化、长程回忆和跨会话推理)上取得了有竞争力的性能。在三个非记忆基准上,NapMem 在选定的推理和工具使用任务上基本保持了性能,表明记忆使用训练不一定会损害更广泛的智能体能力。消融实验表明,性能提升与记忆金字塔和学到的导航策略之间的耦合有关,而工具调用分析揭示了与查询相关的记忆使用行为,为更智能体原生地使用长期记忆提供了见解。我们的贡献可总结如下:

- • 我们将长期用户记忆的使用形式化为主动记忆导航,将记忆从被动检索的上下文重新定义为智能体可以学习使用的结构化动作空间。
- • 我们提出了 NapMem 框架,该框架构建多粒度记忆金字塔,并通过工具暴露原始对话、记忆记录、主题轨迹和用户画像,以实现可控的记忆访问。
- • 我们训练智能体在记忆工具轨迹上使用强化学习来导航这个结构化记忆动作空间。
- • 我们在记忆密集型和非记忆基准上评估 NapMem,分析任务性能、泛化能力、效率和工具使用行为。

## 2 相关工作

#### 记忆构建与组织。
大量工作研究如何为 LLM 智能体构建、组织和维护长期记忆。早期的用户记忆系统如 MemoryBank 和 MemGPT 引入了持久用户历史和虚拟上下文管理,用于长期运行交互(zhong2023memorybankenhancinglargelanguage;packer2024memgptllmsoperatingsystems)。最近的系统进一步探索了不同的记忆架构:Mem0 构建紧凑的记忆记录用于可扩展检索,Zep 将记忆组织为时间知识图谱,MemOS 将记忆视为系统级资源用于记忆增强生成,MemoryOS 提出了层级化的短/中/长期个人记忆架构(chhikara2025mem0buildingproductionreadyai;rasmussen2025zeptemporalknowledgegraph;li2025memosoperatingmemoryaugmentedgeneration;kang2025memoryosaiagent)。其他近期工作从互补的角度改进了记忆组织:A-MEM 以智能体方式动态链接和演化记忆,LightMem 和 SimpleMem 强调轻量压缩和高效整合(xu2026mem;fang2026lightmem;liu2026simplemem)。

#### 用户记忆的自适应检索。
另一类工作改进了检索阶段。反射式记忆管理(RMM)提出了回顾性反思,通过基于引用证据的在线强化学习来优化检索(tan2025prospect)。更广泛地说,面向检索的训练方法如 Search-R1 和 DeepRetrieval 优化了查询生成,使模型能在推理或检索过程中产生更有效的搜索查询(jin2025searchr1;jiang2025deepretrieval)。zhang2026personalize 进一步表明,用户特定信号可以通过在检索前根据用户表达风格和语料结构扩展查询来改进检索。这些方法通过查询生成使检索更具自适应性,但下游智能体仍然遵循固定的记忆使用接口。

#### 基于强化学习与智能体的记忆系统。
基于学习的记忆系统最近探索了如何用可训练的策略替代手工制作的记忆例程。一类工作聚焦于记忆构建,训练智能体使用下游任务反馈来决定应存储什么信息、如何结构化记忆或何时更新记忆(wang2025memalpha;kang2026memreader)。另一类工作将记忆管理视为操作选择问题,智能体学习或编排诸如写入、更新、删除、总结或跨长期和短期存储检索记忆等动作(yan2026memoryr1;yu2026agenticmemory;zhang2026memskill)。最近基于路由的系统进一步将记忆规划外部化,将查询分配到不同的记忆路径或模块(chen2026memflow)。这些研究表明,记忆行为可以通过学习或编排超越固定启发式规则。NapMem 则研究查询时如何利用结构化的用户记忆金字塔,训练单个对话智能体根据中间证据选择记忆层级并细化访问。

## 3 NapMem

本节介绍 NapMem,一个训练智能体在结构化动作空间中导航记忆的框架。我们首先提供框架概述,然后描述多层记忆金字塔的构建、针对不同记忆粒度的五个记忆工具,以及优化记忆导航策略的训练目标。

### 3.1 概述

如图 2(https://arxiv.org/html/2607.05794#S1.F2)所示,给定用户的交互历史,NapMem 构建一个多粒度记忆金字塔,将用户信息从原始对话证据组织到高级用户画像。推理时,智能体通过记忆工具与记忆金字塔交互,并顺序选择要访问的记忆层级。我们使用群体相对策略优化(GRPO)(shao2024deepseekmath)来优化这一记忆使用行为,奖励促进准确答案、有效格式以及在工具调用预算内适当的记忆使用。

### 3.2 多粒度记忆金字塔

NapMem 通过按时间顺序处理用户的交互历史,为每个用户构建独立的记忆金字塔。构建是增量式且自底向上的:新观察到的会话先追加到原始对话层,然后用于提取和协调记忆记录,这可能会进一步更新主题轨迹和用户画像。这样,当新证据扩展、取代或 contradicts 现有记忆时,底层的变化会向上传播。每个层面对同一用户历史提供不同程度的抽象,相邻层级通过溯源链接相连,使智能体在推理时能够在详细的对话证据和总结性的用户理解之间移动。在实现中,下面两层存储为结构化的 JSONL 记录,带有唯一标识符以及辅助的向量和关键词索引,支持精确查找和混合检索。上面两层存储为 Markdown 文件,使其可直接通过记忆工具读取。详见附录 B(https://arxiv.org/html/2607.05794#A2)中的算法 1(https://arxiv.org/html/2607.05794#alg1)。

#### 原始对话。
基础层将原始的用户-智能体交互存储为消息级条目,每条包含原始内容、说话者角色、时间戳和用于精确查找的唯一标识符。这个仅追加的层保留了最高保真度的证据,使智能体在需要时能够恢复细粒度细节。

#### 记忆记录。
第二层将原始对话证据转换为紧凑的记忆记录。该层作为用户记忆的基本语义单元,抽象掉对话冗余,同时保留可检索和可验证的用户信息。我们定义了四种记录类型以覆盖用户信息的不同方面:事实、事件、指令和偏好。记录层通过两阶段增量过程更新。首先,在一批完整的用户-智能体轮次积累后,智能体接收新追加的对话以及最近的记录作为背景,并生成由当前对话支持的新记录。每条记录遵循固定模式,包括唯一记录标识符、类型、文本内容、创建或更新时间、源消息标识符以及其他类型特定的元数据。其次,新提取的记录通过混合检索与现有的相关记录库协调。此步骤移除冗余记录,更新过时或冲突的信息,并在适当时合并相关记录。协调后的记录使用持久的记录标识符注册并建立索引以便后续访问,同时保留更新历史和源消息标识符。这些标识符提供了从紧凑用户记忆记录返回原始对话证据的桥梁。

#### 主题轨迹。
第三层提供中等范围的抽象,将相关记录组织成不断演化的用户中心主题轨迹。虽然记忆记录捕获原子信息,但用户理解的许多维度跨越会话发展,需要跨多个证据的纵向跟踪。主题轨迹维护围绕重复出现的用户主题的累积上下文,并通过智能体驱动的写入过程进行更新。对于新创建或修订的记录,智能体决定是更新现有轨迹、合并相关轨迹还是启动新轨迹。每条轨迹存储为一个文件,包含元数据、简短摘要和主题的叙述性描述。其内容通过显式链接到支持性记忆记录标识符来锚定,使主题轨迹能够捕获跨会话的演变和重复出现的用户上下文,同时保留向下通往记录层的路径。

#### 用户画像。

相似文章

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。

从多模态经验中学会学习

arXiv cs.AI

本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。