揭示模型知识:LLM遗忘中的遗忘集与模型知识的错位
摘要
本文介绍了LLM遗忘中的遗忘集错位,并提出了一种名为CONFS的数据无关框架来解决这一问题,实现了遗忘与效用之间的竞争性平衡。
arXiv:2609.00605v1 公告类型:新
摘要:大型语言模型(LLMs)的机器遗忘通常假设预定义的遗忘集与模型记忆的内容匹配,但在现实隐私设置中,原始训练数据不可访问时,这经常失效。我们将这种差距称为遗忘集错位,并识别出两种情况。在不完全遗忘中,遗忘集遗漏了记忆的信息,导致信息泄露持续存在。在超出知识遗忘中,算法被迫“遗忘”模型从未学习过的知识,扰动参数并降低效用。通过梯度级别分析,我们表明这些行为源于错位的遗忘目标,而非特定的优化选择。然后,我们提出CONfession-to-Forget-Set(CONFS),一种数据无关框架,通过引出并形式化模型的记忆知识来构建与模型对齐的遗忘集。在合成、多模态和真实世界基准测试中,CONFS在几个指标上接近黄金标准性能,实现了竞争性的遗忘-效用平衡,同时比其他数据无关遗忘集构建方法更好地保留效用。
查看缓存全文
缓存时间: 2026/09/02 06:18
# 遗忘集与模型知识在大语言模型遗忘中的错位
来源:https://arxiv.org/html/2609.00605
## 坦白所知:大语言模型遗忘中与模型知识相关的遗忘集错位
###### 摘要
针对大型语言模型(LLMs)的机器遗忘通常假设预定义的遗忘集与模型记忆的内容相匹配,但在原始训练数据不可访问的真实隐私场景下,这种假设常常被打破。我们将这种差距称为*遗忘集错位*,并识别出两种情况。在*欠遗忘*中,遗忘集遗漏了模型已记忆的信息,导致信息泄露持续存在。在*超知识遗忘*中,算法被迫“遗忘”模型从未学过的知识,从而扰动模型参数并降低模型效用。通过*梯度级分析*,我们表明这些行为源于不匹配的遗忘目标,而非特定的优化选择。然后,我们提出了**CONfession-to-Forget-Set(CONFS)**框架,这是一种*数据盲*框架,通过引导并形式化模型记忆的知识来构建与模型匹配的遗忘集。在合成、多模态和真实场景基准测试中,CONFS在多项指标上接近黄金标准性能,达到了具有竞争力的遗忘-效用平衡,同时在效用保持方面优于其他数据盲遗忘集构建方法。
## 1 引言
大型语言模型(LLMs)在海量、异构的数据集上进行训练,这些数据集通常包含敏感的个人信息(Achiam等人,2023 (https://arxiv.org/html/2609.00605#bib.bib1);Touvron等人,2023 (https://arxiv.org/html/2609.00605#bib.bib2);Grattafiori等人,2024 (https://arxiv.org/html/2609.00605#bib.bib3);Bai等人,2022 (https://arxiv.org/html/2609.00605#bib.bib4);Team等人,2023 (https://arxiv.org/html/2609.00605#bib.bib5))。这引入了一个关键漏洞,因为模型在部署时可能会无意中泄露机密数据。为了缓解这些隐私威胁,LLM遗忘作为一种重要的事后解决方案应运而生(Yao等人,2024 (https://arxiv.org/html/2609.00605#bib.bib6);Jang等人,2023 (https://arxiv.org/html/2609.00605#bib.bib7))。在这种设置下,需要移除的敏感数据被预先定义,通常称为*遗忘集*(Geng等人,2025 (https://arxiv.org/html/2609.00605#bib.bib8))。给定该集合,应用各种遗忘策略,使模型选择性地忘记指定信息(Liu等人,2022 (https://arxiv.org/html/2609.00605#bib.bib10);Jang等人,2023 (https://arxiv.org/html/2609.00605#bib.bib7);Zhang等人,2024 (https://arxiv.org/html/2609.00605#bib.bib11);Chen and Yang,2023 (https://arxiv.org/html/2609.00605#bib.bib9))。然而,在真实场景中,依赖于预定义的遗忘集通常是不切实际的(Enck等人,2014 (https://arxiv.org/html/2609.00605#bib.bib12);Romanosky等人,2011 (https://arxiv.org/html/2609.00605#bib.bib13))。假设某个人发现LLM可以泄露其部分个人信息并请求删除(图1 (https://arxiv.org/html/2609.00605#S1.F1))。尽管该人可以指定要删除的细节,但他们无法观察到模型实际记住了哪些细节。因此,请求的遗忘集可能与模型隐藏的记忆知识不同。我们将这种不匹配称为*遗忘集错位*,这是一个现有基准测试大多忽视的情景,这些基准测试假设了完美指定的遗忘目标(Maini等人,2024 (https://arxiv.org/html/2609.00605#bib.bib14);Dontsov等人,2025 (https://arxiv.org/html/2609.00605#bib.bib15);Liu等人,2025 (https://arxiv.org/html/2609.00605#bib.bib16))。在本工作中,我们研究*遗忘集错位*如何在现实设置中从根本上改变遗忘行为。我们首先识别出两种*遗忘集错位*类型,每种都会导致独特的失效模式。当记忆中的敏感信息从提供的遗忘集中遗漏时,会发生*欠遗忘*。在这种情况下,遗忘效果主要局限于请求的事实,无法推广到相关的实体级知识,使核心隐私风险依然存在。当遗忘集包含模型在训练过程中从未遇到过的信息时,会发生*超知识遗忘*,这会不必要地扰动模型参数,并显著降低通用效用。
(图1 说明:仅部分用户个人信息被保留为模型的记忆知识,但此边界对用户隐藏。因此,删除请求可能遗漏已记忆的信息(*欠遗忘*)或包含未记忆的信息(*超知识遗忘*),从而导致隐私泄露或不必要的效用降低。)
基于这些发现,我们引入**CONfession-to-Forget-Set(CONFS)**,它通过提示模型*坦白*其自身的记忆知识来动态生成遗忘集。我们引出模型的记忆知识并将其形式化为一组离散的“主体-关系-客体”三元组,将模糊的语义信息转化为可验证的原子单元。为确保全面覆盖,我们采用递归的*再坦白*过程,迭代地探测模型的隐藏细节,有效减少遗忘集中的缺口。通过构建与模型记忆知识相匹配的遗忘集,CONFS减轻了*遗忘集错位*的不良影响。尽管在完全*数据盲*设置下运行且无法访问预训练数据,CONFS在多项指标上接近黄金标准性能,达到了具有竞争力的遗忘-效用平衡,同时比替代的代理遗忘集构建方法更好地保持了效用。这些结果表明,可靠的遗忘不仅取决于优化目标,还取决于遗忘集是否与模型实际知道的内容相匹配。
**表1:TOFU合成作者上的初步结果。** 我们评估四个划分:(i)DL− 𝒟_{L−}(已泄露:是 / 请求删除:否),(ii)DL+ 𝒟_{L+}(已泄露:是 / 请求删除:是),(iii)保留集Dretain 𝒟_{retain},和(iv)真实作者集DRA 𝒟_{RA}。我们报告了*欠遗忘*(F:DL+ 𝐅: 𝒟_{L+})和*超知识遗忘*(F:DL+∪DN+ 𝐅: 𝒟_{L+} ∪ 𝒟_{N+})的遗忘轨迹。蓝色背景的值表示*欠遗忘*,而橙色背景的值表示*超知识遗忘*。
## 2 相关工作
### 2.1 大语言模型中的机器遗忘
在LLMs中,大多数遗忘方法被框架化为无需完全重训练的事后微调(Geng等人,2025 (https://arxiv.org/html/2609.00605#bib.bib8))。给定一个预定义的遗忘集,这些方法通过梯度上升(Jang等人,2023 (https://arxiv.org/html/2609.00605#bib.bib7);Yao等人,2024 (https://arxiv.org/html/2609.00605#bib.bib6))、基于偏好的损失函数(Rafailov等人,2023 (https://arxiv.org/html/2609.00605#bib.bib17);Zhang等人,2024 (https://arxiv.org/html/2609.00605#bib.bib11);Maini等人,2024 (https://arxiv.org/html/2609.00605#bib.bib14))或强化学习(Schulman等人,2017 (https://arxiv.org/html/2609.00605#bib.bib18);Kassem等人,2023 (https://arxiv.org/html/2609.00605#bib.bib19))来降低目标行为,同时保留集通过辅助目标来保持效用。除了自回归LLMs,遗忘最近已扩展到掩码扩散语言模型(Lee等人,2026 (https://arxiv.org/html/2609.00605#bib.bib32))。尽管优化策略存在差异,先前的工作普遍假设删除目标完全由预定义的遗忘集捕获。
### 2.2 基准测试与遗忘集构建
现有的LLM遗忘基准测试大致分为合成和真实场景基准测试,区别在于遗忘集的构建方式。合成基准测试,如TOFU(Maini等人,2024 (https://arxiv.org/html/2609.00605#bib.bib14))、CLEAR(Dontsov等人,2025 (https://arxiv.org/html/2609.00605#bib.bib15))和MLLMU(Liu等人,2025 (https://arxiv.org/html/2609.00605#bib.bib16)),构建虚构的人物角色,并通过微调明确注入其信息,将遗忘集定义为注入内容的子集。这种设计有意地将遗忘集与模型的记忆知识对齐,实现可重复的评估,但偏离了真实的隐私泄露场景。相比之下,真实场景基准测试处理对真实个体事实知识的遗忘。RWKU(Jin等人,2024 (https://arxiv.org/html/2609.00605#bib.bib20))在*数据盲*设置下运行,其中遗忘集和保留集语料库均不可访问。它通过提示目标模型生成与目标相关的事实文本来构建代理遗忘集。虽然这避免了依赖原始训练数据,但由此产生的遗忘信号源于非结构化文本,难以精确隔离记忆的个人信息。
### 2.3 不当遗忘集的不利影响
近期工作表明,不当指定的遗忘集可能在遗忘过程中诱发不利影响。在对抗性设置中,恶意的删除请求会诱发异常梯度而非移除特定知识,触发无差别的参数更新和广泛的性能下降(Huang等人,2024a (https://arxiv.org/html/2609.00605#bib.bib21);Hu等人,2023 (https://arxiv.org/html/2609.00605#bib.bib22))。当对已被部分遗忘的信息重复应用遗忘时,也会出现相关问题(Wang等人,2025 (https://arxiv.org/html/2609.00605#bib.bib23);Zhao等人,2024 (https://arxiv.org/html/2609.00605#bib.bib24);Huang等人,2024b (https://arxiv.org/html/2609.00605#bib.bib25);Yang等人,2025 (https://arxiv.org/html/2609.00605#bib.bib26))。在这种情况下,即使知识所剩无几,低置信度的目标仍可能诱发大幅梯度,导致保留性能不必要的退化。重要的是,这些影响不仅限于对抗性设置。在真实场景中,预定义的遗忘集往往无法与模型的记忆知识对齐,即使没有恶意意图,也会破坏遗忘的稳定性并降低整体性能。我们将在第3节 (https://arxiv.org/html/2609.00605#S3) 分析这种*遗忘集错位*。
遗忘实验通常假设预定义的遗忘集与模型的记忆知识之间完美对齐(Maini等人,2024 (https://arxiv.org/html/2609.00605#bib.bib14);Dontsov等人,2025 (https://arxiv.org/html/2609.00605#bib.bib15))。在这种假设下,遗忘集上的性能下降被解释为成功移除了目标知识。然而,在实践中,用户通常无法访问LLM的预训练数据,因此无法观察模型记住了什么。结果,他们定义的遗忘集可能与模型的实际知识不匹配,我们将这种差距称为*遗忘集错位*。在本节中,我们首次系统研究*遗忘集错位*,分析其在真实请求场景下如何降低遗忘效果。
### 3.1 构建错位的遗忘集
**受控数据集。** 我们使用TOFU数据集(Maini等人,2024 (https://arxiv.org/html/2609.00605#bib.bib14)),该数据集包含200个虚构实体,并选择其中20个作为遗忘目标。TOFU为每个目标实体提供20个问答对。从中,我们使用15个问答对(记为 𝒟_{qa}),并沿两个轴对每个样本进行分类:是否在预训练期间注入,以及用户是否请求遗忘。剩余的五个样本在预训练期间既未注入也未被请求遗忘,因此被排除,因为它们不对应任何遗忘场景。
**表2:按泄露和遗忘请求对问答对进行的受控划分。** DL− 𝒟_{L−}:请求中遗漏的已泄露数据。DN+ 𝒟_{N+}:请求中包含的未记忆数据。我们将15个样本划分为三个大小相等且互不相交的子集:DL+ 𝒟_{L+}、DL− 𝒟_{L−} 和 DN+ 𝒟_{N+}。在此有限的问答预算下,等分的三方划分产生每个子集5个问答对。在每个子集的下标中,L和N分别表示已泄露和未泄露样本,而+和-分别表示已请求和未请求样本。特别是,DN+ 𝒟_{N+} 包含模型在预训练期间从未见过但用户包含在遗忘请求中的问答对。此划分总结在表2 (https://arxiv.org/html/2609.00605#S3.T2) 中,并对应于图1 (https://arxiv.org/html/2609.00605#S1.F1) 所示的遗忘场景。为了验证我们的观察并非特定于这个小的受控划分,表5 (https://arxiv.org/html/2609.00605#S4.T5) 在主实验中使用的更大遗忘集上检验了相同的效果。除了这些私有信息子集外,我们还评估了效用保持和通用知识保留。对于效用,我们使用官方的TOFU保留划分 𝒟_{retain},其中包含关于非目标实体的问答对。对于通用知识,我们使用真实作者集 𝒟_{RA},其中包含关于真实世界作者的问答对。我们使用令牌概率(Prob.)和ROUGE-L(R-L)在这四个集合上评估模型性能:𝒟_{L+}、𝒟_{L−}、𝒟_{retain} 和 𝒟_{RA}。关于此分析设置的更多详细信息,请参见附录B.1 (https://arxiv.org/html/2609.00605#A2.SS1)。
(图2 遗忘集错位下的梯度分析。(a) *欠遗忘*:梯度内积通过 E_{tf} 和 E_{eg} 汇总。(b) *超知识遗忘*:来自方程 (5 (https://arxiv.org/html/2609.00605#S3.E5)) 的内积 ⟨g_{L+},g_{retain}⟩ 和 ⟨g_{N+},g_{retain}⟩。)
### 3.2 遗忘设置
**梯度上升(GA)。** 为分析错位的影响,我们使用GA,一种代表性的遗忘基线。对于一个问答对 (q,a),其答案长度为 T,我们使用答案负对数似然 L(q,a;θ) := -∑_{t=1}^{T} log p_θ(a_t | q, a_{<t})。对于数据集 D...相似文章
基于边际自校正的大规模快速遗忘
介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。
大语言模型真的能遗忘吗?通过对抗性评估揭示遗忘差距
该研究揭示了大语言模型在机器遗忘方面的显著差距,表明对抗性评估能够揭示遗忘信息的可恢复性,即使在使用强标准指标的情况下,凸显了对抗性压力测试的必要性。
窄域遗忘,广域保留:作为非对称泛化问题的机器遗忘
本文将大型语言模型中的机器遗忘界定为一个非对称泛化问题,提出了SUITE评估协议与训练语料库以解决遗忘不足与过度遗忘问题,并介绍了JensUn++算法,该算法在三个大型语言模型上实现了最佳的遗忘-保留效用权衡。
在遗忘中应忘记什么?语言模型的遗忘集策划
本文探讨了语言模型中机器遗忘的遗忘集策划,引入了一个评估逐字输出抑制的基准,并强调了效果与能力保留之间的权衡。
模型遗忘目标因语言功能不同而异
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。