学习用户感知召回:长期对话记忆中的个性化检索

arXiv cs.AI 论文

摘要

本文介绍了Profile-guided Personalized Retrieval Optimization (PPRO),一种通过将用户画像融入记忆检索并利用强化学习优化检索的框架,增强了长期对话智能体的能力,在现有方法上实现了持续改进。

arXiv:2607.00017v1 公告类型:交叉 摘要:长期对话智能体理应记住过去的交互,但记忆只有在为正确的用户召回正确的证据时才有用。现有的记忆增强型LLM智能体在构建紧凑记忆库方面取得了进展,但检索仍然往往由以查询为中心的相似性或固定排序规则驱动,导致用户条件相关性的探索不足。为了解决这一差距,我们提出了Profile-guided Personalized Retrieval Optimization (PPRO),一个以检索为中心的框架,使记忆检索既具有用户感知性又可优化。PPRO从对话历史中构建情景记忆库和语义记忆库,并从累积的记忆中推导出用户画像。该画像在记忆排序中作为显式的个性化先验,使检索能够考虑稳定的用户属性、偏好和关系。PPRO进一步使用Group Relative Policy Optimization训练查询重写器,以证据检索质量和下游答案质量作为反馈,同时保持记忆库和答案模型固定。在LoCoMo和LongMemEval-S上的实验表明,与无训练记忆系统和基于训练的基线相比,该方法持续取得改进。消融研究进一步表明,画像引导的排序和检索导向的重写都对性能有显著贡献,突显了检索优化在个性化长期记忆使用中的关键作用。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:42

# 长期对话记忆中的个性化检索
来源:https://arxiv.org/html/2607.00017
## 学习用户感知的回忆:长期对话记忆中的个性化检索

蒋志枢¹,刘海波¹,申鑫¹,²,戚广强¹,苗晨曦¹,李伟康¹,†,钱立伟¹,裴鑫¹,黄继周¹

¹百度公司 ²昆士兰大学 [email protected], [email protected]

###### 摘要

长期对话系统理应记住过往交互,但记忆只有在为正确的用户回忆到正确的证据时才是有用的。现有的记忆增强LLM智能体在构建紧凑记忆库方面取得了进展,但检索仍常由查询中心相似性或固定排序规则驱动,用户条件相关性尚未得到充分探索。为弥补这一不足,我们提出**配置引导的个性化检索优化** (PPRO),一种以检索为中心、使记忆检索既感知用户又可优化的框架。PPRO从对话历史中构建情景记忆和语义记忆库,并从累积记忆中推导出用户画像。该画像作为显式的个性化先验参与记忆排序,使检索能够考虑稳定的用户属性、偏好和关系。PPRO进一步使用组相对策略优化训练查询重写器,以证据检索质量和下游答案质量作为反馈,同时保持记忆库和答案模型固定。在LoCoMo和LongMemEval-S上的实验显示,相较于无训练记忆系统和基于训练的基线方法,PPRO取得了一致的提升。消融实验进一步表明,配置引导的排序和面向检索的重写均贡献显著,凸显了检索优化在个性化长期记忆使用中的关键作用。

学习用户感知的回忆:长期对话记忆中的个性化检索

蒋志枢¹,刘海波¹,申鑫¹,²,戚广强¹,苗晨曦¹,李伟康¹,†,钱立伟¹,裴鑫¹,黄继周¹

¹百度公司 ²昆士兰大学 [email protected], [email protected]

††对应作者

参见图注 图1: 配置引导的个性化记忆检索激励示例。仅查询检索可能返回表面匹配的证据,而配置引导的检索利用用户的偏好、计划和关系,生成更个性化的答案。

## 1 引言

大型语言模型(LLM)智能体日益被期望支持长期个性化交互,其间有用知识需在扩展对话历史中累积并在后续对话中复用(Maharana et al., 2024; Packer et al., 2023; Wu et al., 2026)。近期记忆增强系统通过将历史交互提取、压缩并组织到外部记忆库中,在降低长上下文输入成本方面取得了显著进展(Chhikara et al., 2025; Xu et al., 2025; Liu et al., 2026; Kang et al., 2025; Lewis et al., 2020; Shen et al., 2026; Liao et al., 2026)。随着这些系统走向成熟,核心挑战从单纯记忆构建转向推理时的记忆使用:面对用户查询,智能体必须检索出不仅与查询语义相关,而且对查询背后的用户也恰当的证据(Shen et al. 2021c)。在长期对话中,不同用户累积了反映各自关系、话题兴趣和生活背景的独特记忆(Shen et al. 2021a, b)。因此,相同的查询可能因提问者的不同而对应不同的信息需求。如图1所示,个性化记忆检索要求超越表面查询匹配:检索器必须识别出与查询和用户长期画像共同相关的证据。

现有记忆系统尚未充分解决这种用户条件检索问题。大多数工作聚焦于记忆构建与管理,包括提取、压缩、层次组织、基于图的索引以及读写操作(Liu et al., 2026; Xu et al., 2025; Chhikara et al., 2025)。这些方法提升了存储记忆的覆盖面和效率,但检索常被当作基于语义匹配或启发式评分的固定下游步骤(Gutiérrez et al., 2025; Kim and Jang, 2025; Karpukhin et al., 2020)。另一方面,个性化对话系统虽建模用户特定信息(Zhu et al., 2025; Liang et al., 2025; Zhang et al., 2018; Salemie et al., 2024),但通常侧重于构建个性化记忆内容或在生成阶段使用画像,而非将用户级先验注入检索排序。结果,当前记忆管线可能检索到与查询表面匹配的记忆,却未能优先考虑在用户稳定属性、偏好和关系下更具信息量的证据。

为解决这些问题,我们提出**配置引导的个性化检索优化** (PPRO),一种面向个性化长期对话记忆的以检索为中心的框架。PPRO首先从对话历史中构建层次化记忆表示。它提取情景记忆作为细粒度事实陈述,将相关情景记忆聚合为语义记忆,并将稳定的用户属性、偏好和关系总结为用户画像。在推理时,PPRO对情景记忆和语义记忆进行双路径检索。更重要的是,用户画像不仅作为上下文提供给答案模型,还作为嵌入级别的个性化先验注入检索得分。这种设计使检索器能同时考虑查询相关性和用户级相关性来排序记忆,从而让记忆检索对个性化信息需求更加敏感。

PPRO进一步通过可训练的查询重写器优化检索。由于检索离散记忆项不可微分,梯度无法从答案质量回流到检索器。为此,我们使用组相对策略优化 (GRPO) (Shao et al., 2024; Schulman et al., 2017)训练查询重写器:采样多个重写查询,并根据证据检索质量和最终答案质量给予奖励,同时保持记忆库、嵌入模型和答案模型固定。

我们在两个长期对话问答基准LoCoMo (Maharana et al., 2024) 和 LongMemEval-S (Wu et al., 2025) 上评估PPRO。PPRO在两个基准上一致优于无训练记忆系统和基于训练的基线方法,消融实验证实了用户画像引导、双路径检索、检索维度以及基于GRPO的查询重写的贡献。结果表明,个性化检索优化是记忆构建的有效补充。整体而言,我们的贡献有三方面:

- • 我们将个性化记忆检索表述为长期对话智能体的关键问题,强调检索到的证据应同时与输入查询和目标用户相关。
- • 我们提出PPRO,结合了配置引导的检索和基于GRPO的查询重写以实现个性化记忆回忆。
- • 在LoCoMo和LongMemEval-S上的实验显示,相对于无训练和基于训练的基线方法,PPRO取得了一致的提升。

## 2 相关工作

### 2.1 长期对话记忆

随着领域发展,长期对话记忆的研究已从记忆构建与组织,演进到检索机制设计,再到近期基于学习的优化(Summers et al., 2024; Jiang et al., 2025)。

**记忆构建与组织**。有效的记忆组织是长期对话智能体的基础。MemGPT (Packer et al., 2023) 引入了受OS启发的虚拟上下文管理。A-Mem (Xu et al., 2025) 采用受Zettelkasten启发的动态索引,Mem0 (Chhikara et al., 2025) 构建基于图的记忆库,MemoryOS (Kang et al., 2025) 提出了多级记忆操作系统。SimpleMem (Liu et al., 2026) 通过语义无损失压缩与多视图索引实现了强性能。

**记忆检索机制**。除了更好的记忆组织,如何根据查询准确检索相关记忆同样关键。HippoRAG (Gutiérrez et al., 2025) 借鉴海马索引理论进行多跳检索。THEANINE (Bae et al., 2025) 通过时间-因果图遍历检索,SynapticRAG (Kim and Jang, 2025) 应用生物启发的突触传播进行时间评分,Zep (Rasmussen et al., 2025) 利用时间知识图,CDMem (Wang and others, 2025) 应用基于任务状态的上下文依赖索引。

**基于强化学习的记忆优化**。最近,强化学习已被用于端到端优化记忆系统。Memory-R1 (Yan et al., 2025) 通过GRPO训练记忆CRUD操作的策略。MEM1 (Zhou et al., 2025) 优化思考-搜索-回答循环,MemAgent (Lu et al., 2025) 训练分段阅读进行长上下文压缩,Mem-T (Yue et al., 2026) 采用记忆思维增强的GRPO。然而,这些方法中的RL目标指向记忆管理或推理,并未与检索过程紧密耦合。我们的工作将强化学习与用户感知的个性化检索统一起来,利用来自证据检索质量和答案质量的奖励信号优化检索过程。

### 2.2 用户感知检索

用户感知检索专注于利用用户特定信息提升检索相关性。在推荐中,近期工作通过个性化表示和偏好建模增强用户感知检索(Tan et al., 2024; Kong et al., 2025; Chen et al., 2024; Zhang et al., 2024; Jia et al., 2024)。在对话中,PRIME (Zhu et al., 2025) 将认知双记忆理论映射到LLM个性化,RMM (Liang et al., 2025) 引入反思性记忆管理与RL精炼的检索,InsideOut (Zhao et al., 2026) 演化以用户为核心的核心记忆树,EMG-RAG (Lee and others, 2024) 通过可编辑记忆图构建个性化智能体。我们的工作将用户画像嵌入直接注入检索评分函数作为个性化排序先验,使用户感知检索端到端可优化。

## 3 方法论

我们提出配置引导的个性化检索优化(PPRO),一种以检索为中心的个性化长期对话记忆框架。如图2所示,PPRO从对话历史中构建情景记忆、语义记忆和用户画像,然后利用画像作为个性化先验引导双路径检索。一个经GRPO训练的查询重写器进一步利用证据检索质量和答案质量作为反馈优化检索。

参见图注 图2: PPRO框架概览。上方面板显示离线记忆构建,下方面板显示在线检索、答案生成和GRPO优化。PPRO从对话历史中构建情景记忆、语义记忆和用户画像,然后使用配置引导的双路径检索回忆记忆。一个经GRPO训练的查询重写器进一步利用证据级和答案级反馈优化检索。

### 3.1 问题形式化

给定目标用户 u,我们假设可以访问该用户的长期对话历史 D_u = {d_1, …, d_T},其中每个对话 d_t 包含来自多个说话者的带时间戳的话语序列。给定基于该历史的查询 q,任务是生成与参考答案 y* 匹配的答案 y。

我们专注于个性化记忆检索作为关键的中间步骤。PPRO 用情景记忆库 M^E_u、语义记忆库 M^S_u 和用户画像 P_u 来表示 D_u。推理时,检索器从情景记忆和语义记忆库中选择既与查询相关又与用户相关的记忆。这些检索到的记忆与用户画像一起提供给冻结的答案模型 A,以生成最终答案。

### 3.2 离线记忆构建

离线阶段将原始对话历史转换为持久的用户特定记忆资源。对于每个目标用户,PPRO 构建三个互补组件:用于细粒度事实证据的情景记忆、用于跨对话聚合的语义记忆,以及用于稳定个性化信息的用户画像。我们在所有离线构建阶段使用相同的指令跟随语言模型 G,并配合任务特定的提示。

**情景记忆**。对于每个对话 d_t,G 将对话话语转换为一组原子情景记忆。每个记忆单元 e 是一个事实性文本陈述,并附带检索维度:

M^E_{u,t} = G(d_t, u), e = (c, δ) ∈ M^E_{u,t}, (1)

其中 c 是文本内容,δ 表示附着于记忆的检索维度,包括时态、主观性和确定性。

相似文章

面向偏好变化的记忆检索

arXiv cs.CL

本文提出了一种针对长上下文对话系统中记忆访问与选择的统一框架,利用贝叶斯因子量化历史轮次对建模变化用户偏好的效用。实验表明,在偏好密集型任务中,该框架优于基于嵌入的检索方法。

学习检索:面向文本到SQL智能体的双层长期记忆

arXiv cs.CL

本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。