ForgetBench:语言模型中长期参数记忆遗忘动态的基准测试
摘要
ForgetBench 引入了一个基准测试,用于系统地表征大型语言模型在持续知识编辑下的遗忘行为,通过基于概念和场景的问答来衡量时间衰减和保留动态。
arXiv:2607.26455v1 公告类型:新
摘要:大型语言模型(LLMs)在知识获取和推理方面展现出强大能力,但它们在重复更新下保留先前获取知识的能力仍未得到充分理解。现有的评估范式主要关注单步推理或静态知识编辑,未能捕捉持续模型修改过程中知识保留和退化的时间动态。在这项工作中,我们提出了 ForgetBench,一个旨在系统地表征持续知识编辑下LLMs遗忘行为的基准测试。ForgetBench引入了两种互补的评估范式,即基于概念的问答和基于场景的问答,以将孤立的事实保留与结构化的关系知识保存分离开来。基于顺序编辑框架,我们构建了时间有序的知识流,并评估模型在多个编辑阶段的行为。为了定量分析长期保留动态,我们进一步引入了一个统一的评估框架,对知识随时间演化进行建模,从而能够测量时间衰减、保留强度和跨实例稳定性。跨多种模型和编辑方法的广泛实验表明,现有方法未能实现长期保留与泛化质量之间的平衡。我们的发现强调了未来LLMs需要更强大的记忆机制,能够随时间有效地获取、更新和保留知识。代码将在接收后发布。
查看缓存全文
缓存时间: 2026/07/30 09:58
# ForgetBench:语言模型中长期参数化记忆的遗忘动态基准评估
Source: https://arxiv.org/html/2607.26455
###### 摘要
大型语言模型在知识获取和推理方面展现出强大能力,但它们在重复更新下保留先前获得知识的能力仍未被充分理解。现有的评估范式主要关注单步推理或静态知识编辑,无法捕捉持续模型修改过程中知识保留与退化的时间动态。在这项工作中,我们提出了ForgetBench,一个旨在系统刻画大型语言模型在持续知识编辑下遗忘行为的基准。ForgetBench引入了两种互补的评估范式,即基于概念的问答和基于场景的问答,以将孤立的事实保留与结构化关系知识的保留分离开来。基于顺序编辑框架,我们构建了按时间排序的知识流,并评估模型在多个编辑阶段的行为。为了定量分析长期保留动态,我们进一步引入了一个统一的评估框架,对随时间变化的知识演化进行建模,从而能够测量时间衰减、保留强度和跨实例稳定性。跨多种模型和编辑方法的广泛实验表明,现有方法在长期保留与泛化质量之间难以取得平衡。我们的研究结果强调了未来大型语言模型需要更鲁棒的记忆机制,以有效获取、更新和长期保留知识。代码将在接收后发布。
## 1 引言
记忆对于在动态环境中运行的智能系统至关重要,这些系统必须随时间持续获取、保留和更新知识。受认知记忆研究的启发,记忆通常分为工作记忆和长期记忆。工作记忆支持单次交互中的临时信息操作,而长期记忆则能实现持久的知识保留和渐进遗忘。对于大型语言模型而言,理解这种长期记忆动态变得越来越重要,因为模型预期在部署后需要持续适应。
尽管大型语言模型取得了飞速进展,但大多数现有评估范式主要关注工作记忆能力,例如长输入下的上下文推理或单次推理过程中的多跳问答,而非更新后的持久知识保留。近期研究开始探索交互系统中的长期记忆,包括多会话对话记忆和演化的智能体记忆评估。然而,这些基准主要评估外部维护的记忆,其保留依赖于检索机制、记忆组织或交互历史。相比之下,我们的工作聚焦于内在的参数化记忆,即知识被编码到模型参数中,遗忘源于后续模型更新引起的累积干扰。这种设置对于持续适应尤为重要,因为模型通过参数修改反复获取新知识。
知识编辑最近成为一种有前景的范式,用于在不进行完整再训练的情况下更新大型语言模型中的事实知识。现有的编辑基准(如zsRE和UnKE)通常通过编辑准确性、泛化性和局部性指标来评估单次编辑是否成功。然而,这些评估将编辑视为独立操作,忽略了连续更新之间的时间交互。因此,它们无法回答可靠终身适应中的一个基本问题:今天获取的知识能否在未来修改中幸存下来。
为了填补这一空白,我们提出了ForgetBench,一个用于评估持续知识编辑下大型语言模型长期记忆动态的基准。与测量即时可编辑性的现有编辑评估不同,ForgetBench通过顺序编辑流和重复评估来研究编辑知识的时间存活性。我们构建了两种互补的设置:(i) 基于概念的问答,将原子事实更新分离出来,以受控方式分析参数干扰;(ii) 基于场景的问答,通过多智能体交互图引入结构化关系知识。通过跟踪模型在编辑步骤中的性能,ForgetBench将知识保留表征为遗忘曲线,揭示记忆如何随时间被保留、退化或覆盖。
我们的主要贡献可总结如下:(1) 我们引入了ForgetBench,一个统一的基准,旨在评估持续知识编辑下大型语言模型的长期参数化遗忘动态。超越静态、单步编辑评估,ForgetBench能够在顺序更新过程中对知识获取、保留和遗忘进行时间分析。(2) 我们设计了两种互补的问答构建范式,捕捉孤立的事实更新和结构化关系知识。基于按时间排序的知识流,我们进一步开发了一个评估框架,用于量化保留强度、时间衰减和跨实例稳定性。(3) 跨多个大型语言模型和编辑方法的广泛实验表明,现有编辑方法在维持长期事实保留和泛化能力方面面临挑战。我们的研究结果系统分析了当前知识编辑范式的时间局限性,并激励未来研究朝向更鲁棒的记忆机制。
## 2 相关工作
### 2.1 工作记忆与长期记忆
认知科学中的记忆通常分为短期和长期成分。遵循Atkinson-Shiffrin记忆模型,短期记忆支持正在进行处理过程中的临时信息操作,而长期记忆则实现知识在长时间周期内的持久存储、积累和检索。这一区分激发了近期研究探索语言模型是否能在单次推理上下文之外维持信息。
早期关于大型语言模型记忆的研究主要关注工作记忆能力,包括长上下文推理、上下文工程、键值重用与压缩以及思维链推理。这些方法改进了上下文窗口中临时可用信息的利用,但并未考察新获取的知识能否持久存储在模型参数中。类似地,检索增强生成和外部记忆机制通过外部检索增强知识访问,其中记忆保留依赖于存储、检索或管理策略,而非内在参数更新。
最近的基准已将记忆评估扩展到长期交互场景。现有数据集如HotpotQA、LongBench和LoCoMo评估复杂上下文或对话历史中的推理,而更新的基准和研究进一步调查多会话和演化智能体环境中的记忆一致性。这些研究为基于大型语言模型的系统如何随时间检索和组织信息提供了重要见解。然而,它们的记忆演化主要由外部记忆模块、检索策略或交互历史决定,因此观察到的遗忘反映了记忆访问或管理中的失败,而非内部模型参数之间的干扰。
遗忘曲线提供了另一种描述记忆退化的视角。受艾宾浩斯遗忘曲线启发,Liu等人引入遗忘曲线来分析长上下文语言模型中的记忆化。然而,他们的公式将记忆年龄定义为上下文距离,测量输入序列中呈现的信息随距离的衰减。相比之下,ForgetBench关注持续知识编辑下的内在参数化记忆。ForgetBench不评估序列级衰减或外部维护的记忆,而是将记忆年龄定义为后续编辑操作的数量。通过构建按时间排序的编辑流,它能够分析超越单步编辑的长期稳定性、遗忘动态和累积参数干扰。
### 2.2 知识编辑
知识编辑旨在修改大型语言模型中的事实知识,无需完整再训练。基于因果干预和直接权重修改的早期方法表明,事实关联可以定位在模型参数中并显式改变。基于这一见解,可扩展方法如MEMIT实现了大规模多事实编辑,而AlphaEdit进一步将更新约束到零空间以减轻对无关知识的干扰。近期研究探索了两个主要方向:基于超网络的方法,学习一个辅助模型来预测根据编辑请求调整的参数更新;以及定位然后编辑的方法,首先识别知识关键组件,然后通过优化应用针对性扰动。
评估通常在zsRE、CounterFact和UnKE等基准上进行,测量编辑成功率、释义泛化性以及非目标知识的保持。然而,这些基准本质上是静态的,将每次编辑视为独立操作,限制了其评估长期记忆动态的能力。相比之下,我们的基准引入了按时间排序的编辑,能够直接测量保留、干扰和遗忘曲线。因此,现有编辑基准评估模型能否获取新知识,而ForgetBench进一步研究这些知识能否在长时间编辑范围内从未来更新中幸存下来。
## 3 方法论
### 3.1 ForgetBench 概览
如图1所示,ForgetBench由两种互补的问答构建范式组成,即基于概念的问答和基于场景的问答,二者在知识的粒度和结构组织上有所不同。
 focuses on isolated concepts, while scenario-based QA (b) evaluates structured knowledge understanding. Subsequently, sequential editing (c) exposes the model to these QA sequences and evaluates forgetting dynamics across editing stages.")
图1:ForgetBench 概览。我们构建了两类问答序列。基于概念的问答(a)聚焦于孤立概念,而基于场景的问答(b)评估结构化知识理解。随后,顺序编辑(c)将模型暴露于这些问答序列,并评估跨编辑阶段的遗忘动态。
基于概念的设置聚焦于原子事实属性,每个主体与一个单一属性关联,并随时间独立扰动。这产生了完全解耦的实例,用于研究局部知识更新。相比之下,基于场景的设置通过交互图生成的结构化关系知识构建问答对。首先通过模拟智能体-物品交互生成知识图,然后从采样子图中导出问答实例,并将其转换为自然语言上下文,这要求对相互关联的实体进行推理。基于这两种互补构建,ForgetBench在顺序编辑范式下评估模型,其中新知识随时间持续注入。通过定期测试模型在先前和新编辑实例上的性能,我们获得了细粒度的遗忘轨迹,同时反映即时适应和长期记忆退化。
### 3.2 数据生成
**基于概念的问答**。基于概念的设置在原子主体上构建独立问答实例。每个主体被分配一个属性,其编辑前的值从预定义分布中采样,然后由独立采样的编辑后值替换作为编辑目标。每个问答实例遵循固定的属性查询模板\(Q\),以编辑后属性\(A^{right}\)作为真实答案,编辑前值\(A^{wrong}\)代表被覆盖的记忆(例如,\(Q\):“Donald Rodriguez多大了?”,\(A^{right}\):“22”,\(A^{wrong}\):“79”)。由于所有主体独立采样,这种设置消除了实例间的依赖性,为分析局部知识更新提供了受控环境。
**基于场景的问答**。如算法1所述,基于场景的设置通过动态交互图生成的结构化关系知识构建问答对。我们初始化一个智能体集合\(\mathcal{A}\),并在多个模拟轮次中演化它们的交互,其中活跃智能体参与协作行为,生成实体和关系边。这个过程产生了一个异质知识图\(\mathcal{G}\),包含智能体、物品及其交互。
算法1 基于场景的问答生成
输入:模拟轮数\(K\),子图大小\(L\),子图数量\(N\),每个子图的问题数\(t\)
输出:问答序列\(\mathcal{D}\)
1: 初始化问答序列\(\mathcal{D} \leftarrow \emptyset\),长度\(T = N \times t\)
2: // 阶段1:知识图生成
3: 初始化智能体集合\(\mathcal{A}\),物品集合\(\mathcal{I}\)相似文章
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
有限记忆语言模型中的遗忘审计
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。
MemoBench:动态变化环境中世界建模的基准测试
MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。