面向偏好变化的记忆检索
摘要
本文提出了一种针对长上下文对话系统中记忆访问与选择的统一框架,利用贝叶斯因子量化历史轮次对建模变化用户偏好的效用。实验表明,在偏好密集型任务中,该框架优于基于嵌入的检索方法。
arXiv:2606.02976v1 Announce Type: new
摘要:长上下文对话系统需要决定何时访问记忆以及哪些交互历史片段是相关的。现有方法通常依赖启发式检索信号或始终启用记忆,未能考虑用户偏好变化且可能不一致的特性。本文提出了一种基于偏好变化的记忆访问与选择统一框架。我们将个性化记忆检索定义为识别哪些历史轮次能提供用户潜在偏好状态的证据,而非依赖表面语义相似性。为此,我们使用贝叶斯因子量化每个记忆轮次的效用,该因子定义为将该轮次纳入上下文时模型参考响应似然度的提升。这提供了证据强度的原则性度量,以及用于记忆访问和选择的统一信号。通过将记忆检索视为效用估计,模型学会识别关键轮次并根据预期效用调节记忆使用。在四个异构记忆基准上的实验表明,在需要建模变化偏好的长上下文、偏好密集型任务中,我们的方法优于现有的基于嵌入的检索方法,同时在语义相似性足以胜任的低密度场景中保持竞争力。
查看缓存全文
缓存时间: 2026/06/03 09:36
# 偏好变化场景下的记忆检索
**来源:** https://arxiv.org/html/2606.02976
Yuehan Qin, Li Li, Linxin Song, Wei Yang, Jiate Li, Yuqing Yang, Yue Zhao
南加州大学 \{yuehanqi@usc\.edu\}
###### 摘要
长上下文对话系统必须决定何时访问记忆以及交互历史中的哪些部分具有相关性。现有方法通常依赖启发式检索信号或始终启用记忆,未能考虑用户偏好可能变化且不一致的特性。在本工作中,我们提出一个基于偏好变化的统一记忆访问与选择框架。我们将个性化记忆检索建模为识别哪些历史轮次提供了用户潜在偏好状态的证据,而非依赖表层语义相似性。为此,我们使用贝叶斯因子量化每个记忆轮次的效用,定义为将该轮次纳入上下文后模型对参考答案似然性的提升。这提供了一个衡量证据强度的原则性指标,并为记忆访问和选择提供了统一信号。通过将记忆检索视为效用估计,模型学会根据预期效用来识别显著轮次并调节记忆使用。在四个异构记忆基准上的实验表明,我们的方法在建模偏好变化至关重要的长上下文、偏好密集型任务上优于现有基于嵌入的检索方法,同时在语义相似性即足够的低密度场景中保持竞争力。
## 1 引言
随着用户与对话AI系统长时间交互,他们积累了丰富的偏好、经验和变化信念的历史。一个在回答新查询时无法有选择地利用这些历史的系统,无法提供个性化所需的连续性 (Yang et al., 2026 (https://arxiv.org/html/2606.02976#bib.bib29))。然而,当交互历史增长到跨越数百个会话时,关注所有内容在计算上是不可行的 (Ding et al., 2024 (https://arxiv.org/html/2606.02976#bib.bib9); Li et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib27)),而关注错误内容则会严重降低响应质量 (Liu et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib1); Shi et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib33); Amiraz et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib2))。大型模型在面对嘈杂或误导性上下文时容易产生幻觉或依赖虚假线索,这一已有充分记录的趋势进一步加剧了挑战 (Shawn et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib24); Li and Zhao, 2026 (https://arxiv.org/html/2606.02976#bib.bib26))。这使得记忆检索成为个性化AI的核心挑战。给定一个新查询,系统必须识别哪些过去的交互对于产生正确且上下文适当的响应具有真实效用。
已成为标准实践的方法是语义嵌入相似性:对每个记忆轮次和输入查询进行编码,选择嵌入空间中最接近的轮次作为上下文 (Chhikara et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib3); Wu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib5); Li et al., 2025d (https://arxiv.org/html/2606.02976#bib.bib18); Xu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib8); Tan et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib4))。然而,语义相似性是错误数量的代理。它测量嵌入空间中的主题共现,而非记忆轮次是否为解决当前查询提供了增量证据。这种区别在许多检索场景中无关紧要,但在个性化中变得至关重要,因为同一主题可能出现在反映用户根本不同状态的轮次中。这种不匹配表现为几种结构性失败模式。
首先,语义相似的轮次可能对应不兼容或被取代的潜在偏好状态,导致检索系统提供主题相关但不再适用于当前查询的上下文 (Jiang et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib6); Zhao et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib7))。其次,证据效用通常是稀疏的、时间上遥远的,或与查询表层形式只有弱对齐。因此,主要基于语义相似性的检索方法倾向于偏好词汇或主题重叠,而非真正决策相关的证据。类似的表层相关性偏差也在其他结构化预测场景中被观察到 (Li et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib17), 2024 (https://arxiv.org/html/2606.02976#bib.bib16))。图1 (https://arxiv.org/html/2606.02976#S1.F1) 给出了一个例子。
这种失败反映了现有记忆系统分解检索问题方式的更深层问题。大多数系统独立处理两个耦合决策:外部记忆是否应影响对给定查询的响应,如果是,哪些轮次值得检索 (Packer et al., 2024 (https://arxiv.org/html/2606.02976#bib.bib10); Chhikara et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib3); Tan et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib4))。访问通常通过始终启用或粗略启发式处理,而选择则依赖语义相似性 (Li et al., 2025a (https://arxiv.org/html/2606.02976#bib.bib28); Wu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib5))。这两个决策都没有基于对当前查询记忆效用的直接估计。结果,系统检索的是相关的,而非有用的。
图1:个性化记忆检索方法的示意图。对于一般推荐请求,语义嵌入检索返回表层相似但证据信息不足的轮次(例如,关于创造性的抽象自我反思),导致LLM给出通用推荐。我们的基于贝叶斯因子的检索则定位用户最近向自然录音的偏好转变,使LLM能生成正确的偏好对齐推荐。
我们认为这两个决策可以在单一原则下统一:当且仅当一个记忆轮次提供了改善响应正确性的证据时才应被检索,并且仅当存在此类证据时才应访问记忆。我们通过贝叶斯视角来操作化这一原则,将每个候选轮次视为潜在证据,并测量它如何将模型的信念更新到正确答案上。我们将贡献总结如下:
- • **个性化记忆的原则性检索信号**。我们将效用增益解释为贝叶斯因子,为语义相似性提供了一个原则性替代方案,能够捕捉证据效用而非主题相关性。
- • **贝叶斯因子门控记忆框架**。我们提出了一个简单框架,将 (i) 决定何时触发记忆访问的离散门控机制与 (ii) 识别相关上下文的基于显著性的选择机制相结合,两者都由相同的贝叶斯因子信号驱动。
- • **区分性证据**。通过受控消融实验,我们展示了基于贝叶斯因子的显著性标签与基于嵌入的替代方案不可互换,在长上下文偏好任务上差异最大(MemBench-High 上 +8.76pp),并且对这些标签进行监督微调对于所观察到的增益至关重要。
- • **改进的长上下文个性化**。我们在多个个性化基准上展示了一致改进,在需要长范围记忆推理的挑战性实例上增益最大。
## 2 相关工作
大型语言模型已广泛成为个性化助手,涵盖从写作支持到定制推荐等多种任务 (Salemi et al., 2024 (https://arxiv.org/html/2606.02976#bib.bib34); Yang et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib23); Li et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib27); Gu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib21); Zhao et al., 2025a (https://arxiv.org/html/2606.02976#bib.bib20); Li et al., 2025c (https://arxiv.org/html/2606.02976#bib.bib19))。随着交互历史在会话间积累,有效利用它们需要选择性记忆访问:关注一切在计算上不可行,而关注错误轮次会降低响应质量 (Liu et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib1))。早期记忆系统如 MemGPT (Packer et al., 2024 (https://arxiv.org/html/2606.02976#bib.bib10)) 和 MemoryBank (Zhong et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib11)) 通过维护外部记忆存储来解决上下文窗口限制。更近期的系统如 Mem0 (Chhikara et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib3)) 和 A-MEM (Xu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib8)) 从对话历史中提取和整合事实,而 RMM (Tan et al., 2025b (https://arxiv.org/html/2606.02976#bib.bib4)) 引入了反思性总结以获得更细粒度的检索。这些系统统一依赖语义嵌入相似性进行检索,我们将其识别为在偏好演化下的结构性局限。
一些工作提出使用效用增益作为上下文质量信号。RECOMP (Xu et al., 2023 (https://arxiv.org/html/2606.02976#bib.bib12)) 使用生成器反馈进行上下文压缩,CODEFILTER (Li et al., 2025e (https://arxiv.org/html/2606.02976#bib.bib13)) 将基于似然的影响评分应用于代码补全,而 Liu et al. (2025 (https://arxiv.org/html/2606.02976#bib.bib14)) 表明上下文与查询之间的点互信息与答案准确性相关。我们的工作将这一信号家族适配到个性化记忆检索中,其中将其解释为关于用户偏好变化的贝叶斯因子提供了超越先前启发式应用的原则性动机。
## 3 方法论
##### 问题设置
设对话历史为 \(\mathcal{H} = (c_1, c_2, \ldots, c_T)\),用户查询为 \(q\),以及(未知的)答案为 \(a\)。目标是选择轮次的子集 \(\mathcal{F} \subseteq \mathcal{H}\),使得以 \((q, \mathcal{F})\) 为条件的模型能够产生正确答案。这个问题涉及两个耦合决策:(i) *是否* 应该咨询记忆,以及 (ii) *哪些* 轮次应该被检索。
### 3.1 阶段1:答案条件显著性
遵循证据的贝叶斯观点,我们将 \(\mathrm{Sal}_a(c_i)\) 视为轮次 \(c_i\) 对于答案 \(a\)(以查询 \(q\) 为条件)的 *对数贝叶斯因子*:当且仅当观察到该轮次将答案分布更新到超出仅由查询建立的范围时,该轮次才构成真实的记忆证据。形式上,\(p(a\mid q)\) 是模型在仅给定查询时对答案的先验信念,而 \(p(a\mid q, c_i)\) 是观察到轮次 \(c_i\) 后的后验。那么 \(\mathrm{Sal}_a(c_i)\) 是两者之间的对数比率:
\[
\mathrm{Sal}_a(c_i \mid q, a) = \log p(a\mid q,c_i) - \log p(a\mid q),
\tag{1}
\]
这对应于经典的对数贝叶斯因子,量化了 \(c_i\) 支持 \(a\) 的强度。在实践中,我们使用较小的语言模型计算这两个项以提高效率。贝叶斯因子接近统一的轮次(例如,当查询询问位置时的职业事实)被正确抑制;使后验显著偏向正确答案的轮次获得较高的 \(\mathrm{Sal}_a\)。这与基于嵌入的检索形成直接对比,后者测量查询-轮次相似性,因此无法区分 *证据相关性* 与 *主题相关性*。
**Oracle 焦点集**。我们将阈值 \(\tau\) 下的 oracle 焦点集定义为:
\[
S_\tau = \{ c_i \in \mathcal{H} : \mathrm{Sal}(c_i \mid q, a) > \tau \},
\tag{2}
\]
其中 \(\mathrm{Sal}(c_i \mid q, a)\) 表示轮次 \(c_i\) 在给定查询 \(q\) 和黄金答案 \(a\) 下的答案条件显著性,\(\tau\) 是控制保留证据量的阈值。\(S_\tau\) 代表记忆的 oracle 概念:它包含那些恰好改善答案预测的轮次。
### 3.2 阶段2:查询条件代理
\(\mathrm{Sal}_a(c_i; q)\) 依赖于未知的黄金答案 \(a\),因此在推理时无法直接获得。为获得易处理的近似,我们将答案 \(a\) 替换为可观察的查询 \(q\),得到查询条件的贝叶斯因子:
\[
\mathrm{Sal}_q(c_i; q) = \log p(q\mid c_i) - \log p(q).
\tag{3}
\]
这里 \(p(q)\) 是模型对孤立查询的先验概率,\(p(q\mid c_i)\) 是观察到轮次 \(c_i\) 后查询的似然。因此 \(\mathrm{Sal}_q\) 是两者的对数比率——一个衡量 \(c_i\) 构成查询证据强度的贝叶斯因子¹。虽然 \(\mathrm{Sal}_q\) 不以答案为条件,我们现展示它是一个原则性的 \(\mathrm{Sal}_a\) 代理,而非启发式替代。我们的论证分三步:精确分解(命题1)、排名等价的充分条件(定理3),以及实际情形下的有界近似结果(定理4)。
¹ 等价地,\(\mathrm{Sal}_q(c_i; q) = \mathrm{PMI}(q; c_i)\),将我们的信号与检索增强生成中研究的点互信息上下文质量度量家族联系起来 (Liu et al., 2025 (https://arxiv.org/html/2606.02976#bib.bib14))。
##### 精确分解。由贝叶斯更新的链式法则,\(c_i\) 对于对 \((a,q)\) 的联合贝叶斯因子可加性分解:
###### 命题 1(联合贝叶斯因子分解)。对于任意候选轮次 \(c_i\)、查询 \(q\) 和答案 \(a\),
\[
\underbrace{\log \frac{p(a,q\mid c_i)}{p(a,q)}}_{\mathrm{BF}_{(a,q)}(c_i)} = \underbrace{\log \frac{p(a\mid q,c_i)}{p(a\mid q)}}_{\mathrm{Sal}_a(c_i)} + \underbrace{\log \frac{p(q\mid c_i)}{p(q)}}_{\mathrm{Sal}_q(c_i)}.
\tag{4}\]
恒等式 (4) 是精确且无假设的。它表明 \(\mathrm{Sal}_q\) 并非无关的启发式,而是 \(c_i\) 为对 \((a,q)\) 提供的联合证据中的两个加性分量之一;按 \(\mathrm{Sal}_q\) 排序等价于按 \(\mathrm{BF}_{(a,q)} - \mathrm{Sal}_a\) 排序,而该排序何时与 \(\mathrm{Sal}_a\) 一致的问题归结为两个项相对大小的问题。
##### 代理何时保持排名?我们现识别一个条件,在该条件下 \(\mathrm{Sal}_q\) 和 \(\mathrm{Sal}_a\) 在候选轮次上诱导出相同顺序(最多相差一个常数)。
###### 定义 2(查询条件充分性)。一个轮次 \(c_i\) 对 \((q,a)\) 是*查询充分的*,如果 \(q \perp a \mid c_i\),即 \(p(a\mid q,c_i) = p(a\mid c_i)\)。相似文章
学习用户感知召回:长期对话记忆中的个性化检索
本文介绍了Profile-guided Personalized Retrieval Optimization (PPRO),一种通过将用户画像融入记忆检索并利用强化学习优化检索的框架,增强了长期对话智能体的能力,在现有方法上实现了持续改进。
学习检索:面向文本到SQL智能体的双层长期记忆
本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏
CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。