Supersede: 诊断与训练LLM代理中的记忆更新缺口

arXiv cs.CL 论文

摘要

介绍了Supersede,一个用于诊断和训练LLM代理中记忆更新差距的环境,表明标准模型无法在对话增长时维护当前事实,而GRPO微调可以提升性能。

arXiv:2606.27472v1 公告类型:新 摘要:大型语言模型(LLM)代理在长时间、多会话的交互中运行,其中事实会发生变化:用户搬家、价格更新、计划修改。正确操作需要使用事实的当前值,并丢弃已被取代的值。我们在真实对话数据上分离出这一能力,并表明这是一个独特的、尚未解决的失败。在LongMemEval的知识更新子集上,即使使用前沿模型(gpt-5.4),将代理的完整上下文替换为受限的、自维护的记忆也会使准确率从92%下降到77%,这一差距具有统计学显著性(配对McNemar检验p<0.005),并且在不同模型规模下持续存在,而全上下文准确率则饱和在92%附近。因此瓶颈在于记忆维护,而非理解能力,并且不能通过更强的模型来弥补。我们进一步探究这是否仅仅是记忆容量不足,结果发现并非如此:随着对话长度增加24倍,准确率进一步下降(从68%降至28%),而为代理提供成比例更多的记忆并未带来可检测的恢复(28%至28%,n=25)。失败与对话长度成正比,而非压缩比。我们发布了Supersede,一个开放的强化学习环境(基于verifiers/prime-rl栈),将这一测量转化为训练信号:代理根据当前值回答将获得奖励,而使用过时值则会受到惩罚。最后,我们闭环验证了该差距是可训练的:在此环境中对小型开放模型(Qwen2.5-3B)进行GRPO微调,在真实未见对话上的保留超集准确率几乎翻倍(从9.0%到16.7%,单次运行),单调的检查点曲线表明,增益来自学习到的策略,而非训练框架本身。据我们所知,这是第一个奖励目标针对时间事实时效性的可训练环境,也是第一个表明超集差距不仅可以测量,还可以通过训练缩小的证据。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:22

# 诊断与训练LLM智能体中的记忆更新缺口
来源: https://arxiv.org/html/2606.27472

###### 摘要

大语言模型 (LLM) 智能体越来越多地运行在跨多轮会话的长期交互中,其中事实会发生变化:用户搬家、价格更新、计划被修改。正确行动需要使用事实的*当前*值,并丢弃已被*取代*的值。我们在真实的对话数据上分离出这一能力,并证明它是一个独立且尚未解决的失败。在 LongMemEval 的*知识更新*子集上,将智能体的全上下文替换为有界的、自我维护的记忆后,即使是在前沿模型 (gpt-5.4) 上,准确率也从92%下降到77%,这一差距在统计上显著 (配对McNemar检验p<0.005),并且*在模型规模增加时持续存在*,而全上下文准确率则饱和在92%附近。因此,瓶颈在于记忆维护,而非理解能力,并且更强的模型也无法解决。接着,我们探究这是否仅仅是记忆空间不足的产物,结果发现并非如此:当对话长度增长24倍时,准确率进一步下降 (从68%降至28%),并且给智能体成比例地增加记忆空间并未带来可察觉的恢复 (28%→28%, n=25)。失败与对话的长度成正比,而非与压缩比率相关。我们发布了Supersede,这是一个开源的强化学习环境 (构建于verifiers/prime-rl 框架之上),它将这种测量转化为训练信号:智能体因根据当前值作答而获得奖励,因使用过时值而受到惩罚。最后,我们完成了闭环,证明这一缺口是可训练的:使用GRPO在此环境上微调一个小型开源模型 (Qwen2.5-3B) 使其在真实未见过对话上的保留集取代准确率几乎翻倍 (9.0%→16.7%, 单次运行),并且沿着单调的检查点曲线表明是学习到的策略,而非训练框架本身带来了提升。据我们所知,这是第一个奖励目标是事实时间正确性的可训练环境,也是首个证据表明取代缺口不仅可被测量,更可以被训练消除。

## 1 引言

预训练已经几乎消耗了整个开放网络,而LLM能力的边界已转向那些利用*外部记忆*(而非单一上下文窗口)在长时间跨度上行动的智能体。长时间跨度交互的一个决定性特征是信息并非静态:事实被引入,之后又被更新或撤回。一个被告知用户住在底特律、后来又得知用户搬到郊区的助手,在面对后续的位置问题时必须回答*当前*值。我们将对此类更新的正确处理称为*取代*,并将智能体在必须通过有界、自我维护的记忆来维持这一能力时产生的准确率下降称为*取代缺口*。本文测量了这一缺口,展示了显而易见的补救措施无法消除它,并最终通过训练将其消除。

最近的基准测试已经开始衡量长期记忆 (Maharana et al., 2024; Wu et al., 2025; He et al., 2026; Hu et al., 2025; Uddin et al., 2026),并且提出了一个遗忘感知指标来惩罚对过时信息的依赖 (Uddin et al., 2026)。然而,这些工作评估的是*冻结*的模型:它们量化了问题,但没有提供一种机制来*训练*解决它。与此同时,一系列工作将强化学习应用于记忆智能体 (Yu et al., 2025; Chen et al., 2026),但其奖励针对的是最终答案的正确性或证据相关性,从未涉及时间正确性。现有工作并未涉足这一交叉点:即*可训练*的环境中奖励是取代正确性。

本文做出了五项贡献,组织成一项系统调查:我们依次探究失败是否存在,更大的模型能否修复,更大的记忆能否修复,以及*训练*能否修复——答案分别是:否、否、否、是。前三个答案确定了简单的逃脱路径已被关闭;第四个答案表明原则性的路径是开放的。

1. 1.隔离结果。在真实对话数据上,我们保持记忆负载不变,仅改变智能体拥有的是全上下文还是有界的自我维护记忆。有界记忆显著降低了*知识更新*准确率 (第5.1节),隔离了记忆维护(而非阅读理解)作为原因。
2. 2.前沿模型确认。该缺口在 gpt-5.4 上依然存在 (92%→77%, p=0.0033),并且不会随着模型改进而缩小至零;相比之下,全上下文准确率饱和。更大的模型无法修复它。
3. 3.规模,而非大小。当对话长度增长24倍时,失败加深 (68%→28%),并且在 n=25 时,给智能体成比例地增加记忆空间并未带来可察觉的恢复 (第5.2节)。失败与对话长度成正比,而非压缩比率,因此更大的记忆也无法修复它。
4. 4.
5. 5.训练消除它。使用GRPO在环境上微调一个小型开源模型 (Qwen2.5-3B),使得在真实未见过对话上的保留集取代准确率几乎翻倍 (9.0%→16.7%, 第5.3节;单次训练运行,多随机种子的显著性研究正在进行中),并且随着训练进行呈单调提升。在更大的模型和更大的记忆都无法做到的地方,一个经过训练的记忆策略做到了,将诊断转变为修复。

## 2 相关工作

#### 长期记忆基准测试。

LoCoMo (Maharana et al., 2024) 评估了非常长的多轮会话,但没有标注专门的更新类别。LongMemEval (Wu et al., 2025) 引入了一种显式的*知识更新*问题类型,其中一个轮次中提到的事实会在后续轮次中被改变;我们采用这个子集作为真实数据。MemoryArena (He et al., 2026) 表明,在召回基准测试上近乎完美的模型在记忆必须驱动行动时表现急剧下降,这促使了超越被动召回的评估。MemoryAgentBench (Hu et al., 2025) 和 MemBench (Tan et al., 2025) 增加了知识更新和冲突解决能力。Memora 及其 FAMA 指标 (Uddin et al., 2026) 明确惩罚对已取代或已删除记忆的依赖,而时间冲突 QA (Özer & Yıldız, 2025) 则探查模型是否能解决随着时间变化的事实。所有这些都只是评估性质的。

#### 记忆系统与用于记忆的RL。

Mem0 (Chhikara et al., 2025) 通过提示来管理记忆存储(添加/更新/删除操作):这是一种启发式策略,而非学习到的策略。另一条工作线则使用RL来*学习*记忆管理:MemAgent (Yu et al., 2025) 奖励最终答案的正确性,LongRLVR (Chen et al., 2026) 奖励单个长文档内的证据*相关性*,AgeMem (Yu et al., 2026) 在*任务结果*奖励下学习存储/更新/丢弃操作,Memory-T1 (Du et al., 2025) 学习从完整历史中*选择*时间相关的轮次。有两件事将 Supersede 区分开来。首先,这些方法可能会重新读取原始历史;Supersede 禁止重新输入,所以唯一的状态是智能体自身有界的记忆。其次,它们的奖励是任务成功、证据相关性或时间一致性,而非智能体是否保存了已改变事实的*当前*值。Supersede 让这一点成为奖励本身:一个可验证的、带时间戳的取代信号,将 FAMA 的遗忘感知指标 (Uddin et al., 2026) 重新定义为密集训练目标。最接近的同类方法 MemPO (Li et al., 2026) 也将 GRPO 与自我管理的有界记忆配对,但其奖励是记忆任务充分性(关于记忆有效性的信用分配),而非哪个值是当前的。换句话说,先前的 RL-for-memory 工作学习的是*回答什么*;Supersede 学习的是*哪个版本是当前的*:取代信号本身就是奖励,而非其代理。

#### 已部署的记忆系统。

记忆系统在2026年已进入每个主要实验室的生产环境:OpenAI 的 “Dreaming” (OpenAI, 2026)、Anthropic 的 Claude 记忆 (Anthropic, 2026) 以及 Google 的 Gemini 个性化 (Google, 2026) 都运行后台进程来整合和重写用户记忆以保持事实的新鲜度。值得注意的是,OpenAI 自身对更新过时上下文的时效性评估自报成功率仅为75.1%(从2024年的9.4%提升而来),而 Gemini 的文档指出个人资料更新可能滞后数天。这些系统都是封闭的,没有发布基准测试、方法论或可训练信号:这正是 Supersede 填补的缺口。

#### 环境基础设施。

我们构建在 verifiers 库和 Prime Intellect Environments Hub (Prime Intellect, 2025) 之上,后者标准化了用于后训练的环境,并与新兴的 OpenEnv 标准 (Hugging Face and Meta PyTorch and contributors, 2026) 兼容。

## 3 Supersede 环境

#### 任务。

一个任务包括多轮会话交互,随后是一个关于在交互过程中发生改变的事实的当前值的查询。智能体一次处理一个轮次,并维护一个*有界*记忆(一个上限为 B 字符的笔记字段);关键是,原始轮次*永远不会被重新输入*。在最后一轮之后,智能体仅凭其记忆回答查询。图1展示了 rollout 过程。

图 1: Supersede rollout 过程。智能体在每个会话后重写一个有界的笔记记忆,并仅凭记忆回答最终查询。由于历史不会重新输入,一个未被覆盖的已取代值将持续存在并污染答案。

#### 奖励。

主要奖励是 r_cur = 1[最终答案传达了当前值],由程序化的、不可利用的匹配器(归一化变体匹配与词元重叠回退)评分,因此环境可以在没有辅助评判模型的情况下进行评估和训练。当已知已取代值(我们的合成任务或带有更新标注的项目)时,会添加惩罚 r_stale = -1[答案断言了一个已取代值];在仅使用真实数据时,该惩罚无效。组合奖励为 r = r_cur + λ r_stale。本文报告的执行只优化 r_cur(权重 1.0);过时惩罚仅用于环境的消融实验。这使得 Uddin 等人 (2026) 的遗忘感知准确率成为一个密集的训练信号,而非事后分数。

#### 数据。

任务来自 LongMemEval 的*知识更新*子集(真实对话的取代问题)以及一个用于控制和消融实验的程序化生成器生成的合成时间线。环境实现为一个 verifiers MultiTurnEnv;提示组装强制执行无重新输入属性,rollout 在产生答案时终止。

## 4 实验设置

#### 为何使用真实而非合成数据。

我们首先构建了一个模板化取代时间线的程序化生成器(显式的“XX now YY”更新)。当历史在上下文中时,前沿模型在各种配置下达到100%准确率:它们通过最后一次提及扫描来解决干净、显式的更新。因此,合成模板化取代已经*饱和*,无法揭示失败,这很可能就是它被低估的原因。因此,我们在整个过程中使用真实的对话数据,其中更新是隐含的,经过转述的。生成器保留作为控制组以及用于环境的过时惩罚消融。如第5.3节所示,它也可以作为一个训练课程,其学到的技能会迁移回真实数据,将一个饱和的探针变成一个有用的教师。

#### 数据与评分。

我们使用 LongMemEval 的*知识更新*子集。第5.1节使用*oracle*划分中的所有78个问题(只有证据轮次,每个问题约2个轮次),由 LLM 评判模型 (gpt-4.1-mini) 按照 LongMemEval 协议进行评分。由于这个评判模型本身就是被评估的模型之一,我们将其与无评判模型的程序化匹配器(第5.2节)进行交叉验证,两者相差在几个百分点之内,以防止自我评分偏差。第5.2节使用相同的问题,但在更长的 *_s_s* 划分上(约48个轮次,每个问题约122k个词元),由程序化匹配器在所有条件下保持一致以进行公平比较。环境的内在奖励使用相同的匹配器。

#### 条件。

*全上下文*将每个轮次都放入模型上下文中并提问(一个上限,记忆不是瓶颈的情况)。*有界记忆*是第3节中描述的 Supersede 智能体:一个 B 字符的笔记字段(除非另有说明,B=300),一次重写一个轮次,原始轮次永远不会被重新输入。对于规模研究,我们同时变化历史长度(oracle vs. _s_s)和预算 B,包括一个*恒定比率*设置,其中 B 与会话轮次数量成比例增长(每个轮次150字符,与 oracle 比率匹配)。

#### 模型与显著性。

gpt-4.1-mini 和 gpt-4.1 温度为0,前沿推理模型 gpt-5.4 使用reasoning_effort=low(无温度)。条件在同一组问题上运行,因此我们报告配对 McNemar 检验(连续性校正 χ²)。

#### 训练设置。

上述诊断使用了专有的前沿模型,我们无法对其微调;为了测试环境的奖励是否是一个可用的*学习*信号,我们因此切换到一个开源、可训练的模型 Qwen2.5-3B-Instruct (Qwen Team, 2025)。我们使用 GRPO (Shao et al., 2024) 进行训练,它从一组采样的 rollout 中估计基线,而不是使用学习到的值评判模型(这天然适合我们程序化的、可验证的奖励),基于 prime-rl 框架 (LoRA, rank 32, α=64 (Hu et al., 2022); 学习率 10⁻⁵; batch 32, group 8; 4× A10G GPUs)。训练任务来自程序化生成器,使用*有界记忆*模式(一个固定的2000 episode集合,与保留集不相交)。

相似文章

STALE:LLM智能体能否识别记忆何时失效?

Hugging Face Daily Papers

本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。

@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…

X AI KOLs Following

本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。