窄域遗忘,广域保留:作为非对称泛化问题的机器遗忘

arXiv cs.LG 论文

摘要

本文将大型语言模型中的机器遗忘界定为一个非对称泛化问题,提出了SUITE评估协议与训练语料库以解决遗忘不足与过度遗忘问题,并介绍了JensUn++算法,该算法在三个大型语言模型上实现了最佳的遗忘-保留效用权衡。

arXiv:2607.09236v1 公告类型:新 摘要:大型语言模型中的机器遗忘是指在保留所有其他能力的同时,有针对性地移除特定知识,这对隐私和安全至关重要。然而,现有基准测试的评估并不可靠。它们遗漏了在改写或间接查询下会重新浮现的知识,我们称之为遗忘不足;同时缺乏验证无关知识是否被保留所需的语义、句法和词汇探针,我们称之为过度遗忘。这两种失败反映了非对称泛化问题。遗忘评估必须覆盖同一目标事实的多种查询表述,检验遗忘是否在精确训练提示之外仍然成立。保留评估必须探测一个规模更大且隐含定义的集合,即与遗忘目标不相交的所有事实。保留集因此定义了有效的遗忘集,但现有数据集并未提供这种遗忘-保留边界的细粒度标注。为此,我们提出了SUITE——一个评估协议和训练语料库,用于捕获现实世界事实领域中的遗忘-保留结构。基于SUITE训练的方法性能大幅提升,表明训练数据与算法设计同等重要。基于所得见解,我们引入了JensUn++遗忘算法,该算法在三个大型语言模型上(包括顺序遗忘与联合遗忘设置)实现了最佳的遗忘-保留效用权衡。代码和数据集可在 https://amitpeleg.github.io/forget-narrowly-retain-broadly 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 狭隘遗忘,广泛保留:非对称泛化问题视角下的机器遗忘 来源:https://arxiv.org/html/2607.09236 Amit Peleg Naman Deep Singh Naama Pearl Bibhabasu Mohapatra Matthias Hein 蒂宾根人工智能中心,蒂宾根大学 ###### 摘要 大语言模型中的机器遗忘是指在保持所有其他能力的同时,有针对性地移除特定知识,这对于隐私和安全至关重要。然而,现有的基准测试对其评估不可靠。它们遗漏了那些在改述或间接查询下重新浮现的知识,我们将这种失败称为**欠遗忘**;同时,它们缺乏验证无关知识是否得到保留所需的语义、句法和词汇探针,我们将这种失败称为**过遗忘**。这两种失败都反映了一个非对称泛化问题。遗忘评估必须覆盖同一目标事实的多样化查询表述,测试遗忘是否不仅限于精确的训练提示。保留评估则必须探测一个更大且隐式定义的集合,即与遗忘目标不相交的每一个事实。因此,保留集定义了有效的遗忘集,但当前的数据集并未提供这种遗忘-保留边界的细粒度标注。我们通过 SUITE(选择性遗忘孤立主题与事件)来应对这一问题,这是一个评估协议和训练语料库,能够捕捉真实世界事实领域中的遗忘-保留结构。在 SUITE 上训练的方法显著提升,表明训练数据与算法设计同等重要。基于所得见解,我们提出 JensUn++,一种遗忘算法,在三个大语言模型上,无论是顺序遗忘还是联合遗忘设定中,均实现了最佳的遗忘-保留效用权衡。代码和数据集可在 https://amitpeleg.github.io/forget-narrowly-retain-broadly 获取。

## 1 引言

尽管已有多个基准测试评估大语言模型中的遗忘 [19, 42, 7, 14, 30, 21, 36],但一个基本问题仍未解决:**遗忘一个事实同时保留其他所有知识,这究竟意味着什么?** 我们认为,遗忘和保留受制于一个**非对称泛化问题**。遗忘集是有限的,但成功的遗忘必须**强化地**泛化到目标事实的所有查询表述:改述 [28, 43]、间接查询,以及对模型仍然保留的相关事实的潜在推理依赖 [48, 3, 20, 2, 13, 25]。当这失败时,目标信息会在替代措辞 [43, 44] 或间接查询下重新浮现——我们将这种失败模式称为**欠遗忘**。相比之下,保留范围无法穷举:它涵盖了模型所知的“一切其他知识”,并且必须**广泛地**泛化到一个更大且仅隐式定义的集合——即与遗忘集不相交的每一个事实。向外波及到遗忘事实的语义相关概念的遗忘会产生**过遗忘** [37, 3, 44]。因此,保留集定义了有效的遗忘集,任何未能以细粒度级别标注此遗忘-保留边界的基准测试,都无法区分真正的遗忘与压制,也无法区分真正的保留与附带损害。现有的基准测试 [14, 19, 30, 45] 在很大程度上缺乏这种结构,这是大语言模型遗忘领域进一步发展的主要障碍。

为了解决这个问题,我们提出 SUITE:**S**elective **U**nlearning of **I**solated **T**opics and **E**vents(选择性遗忘孤立主题与事件),一个用于遗忘真实世界事实性知识的细粒度评估协议和训练语料库,能够捕捉非对称性的两个方面。在遗忘侧,我们使用训练时未见过的、需要多跳推理的间接问题来探测**欠遗忘**(训练中仅使用直接问题和反向问题)。结合每种问题类型的改述,这可以测试知识是被真正遗忘还是仅仅被压制。在保留侧,我们沿着多个轴探测**过遗忘**。我们检查对查询形式(句法结构)和查询实体(词汇结构)的过拟合,检测那些在内容和形式上类似于遗忘查询但内容不同的查询上的退化。我们还在细粒度的语义尺度上评估保留知识:从遗忘主题中实体的其他事实(对于“挑战者号灾难”,与灾难不同的“航天飞机挑战者号”的事实),到语义相似的实体和主题(“航天飞机哥伦比亚号”、“哥伦比亚号灾难”),再到更远的主题(其他事故、其他太空任务)。通用知识查询测试整体模型能力是否得到保留。

SUITE 的训练集独立于评估集构建(见第3节)。除 RMU [21] 外,所有方法在 SUITE 上训练时都有显著提升——这表明训练数据的选择至少与算法的选择同等重要。一旦训练数据以适当的粒度编码了遗忘-保留边界,先前看似失败的方法开始发挥作用(见表2)。作为第二个贡献,我们提出 JensUn++,一种基于 JensUn [43] 构建的遗忘算法。与 JensUn 不同,它产生有效的拒绝响应,而 JensUn 常常输出无关内容或无意义内容,见图1。JensUn++ 引入了一个自适应的优化方案,平衡遗忘损失和保留损失,一种查询类型的“硬”配对策略,以及鼓励拒绝的随机前缀混合。JensUn++ 在 SUITE 上优于现有的遗忘方法,减少了欠遗忘和过遗忘。

我们总结贡献如下:
- • 我们围绕遗忘集和保留集之间的**非对称泛化问题**重新框架化遗忘评估,由此引出 SUITE:一个包含真实世界事实性知识的细粒度数据集以及一个同时捕捉**欠遗忘**和**过遗忘**的评估协议。遗忘集涵盖直接、反向和间接问题模态;保留集按语义邻近度的分级层次探测主题,并包含句法和词汇敏感性探针以及通用知识查询。
- • 我们跨多个模型和遗忘方法进行了全面的实证研究,揭示了先前评估未发现的失败模式(对间接查询泛化能力差以及对语义相关或句法变体查询存在过遗忘),并表明有效遗忘关键依赖于数据和方法的结合。
- • 我们提出 JensUn++,它在三个方向上改进了 JensUn [43]:针对拒绝字符串的新损失配置,消除了无意义的拒绝;一种在训练期间动态重新加权遗忘和保留损失的自适应优化方案;以及遗忘和保留查询的配对策略,在保持效用的同时提高了保留性能。

## 2 相关工作

**遗忘基准测试与评估框架。** 现有的遗忘基准测试分为两类。第一类针对预训练模型中已经嵌入的知识,包括《哈利·波特》系列 [7]、WMDP 中的危险知识 [21]、RWKU 中的知名个体 [19] 以及 LKF 中鲜为人知的历史事实 [43]。第二类方法先在一个给定数据集上微调模型,然后对其进行遗忘,例如 TOFU [30] 中的合成作者、LUME [36] 中的合成小说,或 MUSE [42] 中的新闻文章和《哈利·波特》文本。虽然这种方法可以与原始模型进行比较,但它不能反映部署后的大语言模型,因为遗忘集以复杂的方式与现有知识纠缠在一起。我们专注于预训练设定。两个类别中没有任何现有的基准测试以诊断非对称泛化问题两边所需的粒度来标注遗忘-保留边界。它们缺乏间接和多跳查询来测试遗忘侧的强化泛化,以及分级的语义、句法和词汇探针来测试保留侧的广泛泛化。SUITE 解决了这两个缺口。

**遗忘方法。** 梯度上升(GA)[17] 最大化遗忘集上的交叉熵损失,这通常会损害其外部的知识。GradDiff [24, 30] 增加了保留集上的交叉熵损失以缓解此问题。偏好优化也被应用于遗忘。直接偏好优化(DPO)[35] 最初用于对齐,将遗忘样本视为不良输出,而 NPO [52] 和 SimNPO [9] 则针对遗忘设定对此目标进行了优化。PDU [8] 将遗忘形式化为一个带有原始-对偶框架的约束优化问题,JensUn [43] 使用 Jensen-Shannon 散度,在训练初期尤其能产生平衡的遗忘和保留梯度。WGA [46] 根据模型置信度重新加权对数似然以避免过度遗忘,UNDIAL [5] 使用自蒸馏来选择性抑制目标 tokens,SatImp [50] 通过损失重加权动态平衡样本,以及 [18] 将遗忘表述为一个多任务优化问题,增加了额外的计算开销。另一类方法针对内部表示 [49, 31]。例如,RMU [21] 编辑某一层,将遗忘集激活导向随机方向,而 LUNAR [40] 将隐藏状态引导至表达无法回答能力的区域。最后,[20] 在输出层面操作,利用模型自身的信念更新遗忘目标。

遗忘方法要么压制遗忘知识(例如 GradDiff、NPO、PDU),要么旨在用拒绝字符串回答(例如 DPO、JensUn、RT [16])。正如我们在图1和附录 C.3 中所示,压制遗忘知识的方法会在遗忘查询上产生无意义答案或有害幻觉,因为没有对输出进行控制。这在伦理和法律上是不可接受的。因此,我们的 JensUn++ 是一种基于拒绝的遗忘方法。

**遗忘主题:布兰妮·斯皮尔斯监护权(警告:内容令人不适)**

图1:遗忘查询上的输出:基于压制的方法如 GradDiff、NPO、PDU 的答案可能是无意义的或包含有害幻觉。相比之下,我们的 JensUn++ 产生恰当的拒绝回复。JensUn [43] 以部分拒绝短语“No idea”开头,但继续生成输出。

## 3 SUITE:选择性遗忘孤立主题与事件

对于每个由一组目标事实定义的遗忘主题 T,我们构建一个单独的遗忘数据集。该协议测试模型是否在多种改述和推理路径下抑制或拒绝回答这些事实,同时保留所有其他能力的表现。我们形式化两个集合:遗忘集 DF 和保留集 DR,每个都分为训练和评估部分:DF-train, DF-eval, DR-train, DR-eval ⊂ X × Y,其中每个 x ∈ X 是一个查询,每个 y ∈ Y 是对应的答案,|DF-train| = Nf^T, |DF-eval| = Nf^E, |DR-train| = Nr^T, |DR-eval| = Nr^E。DF 中的对应应该被移除,DR 中的对应应该保持不变。关键的是,DR-train ∩ DR-eval = ∅,因此在保留实例上测试泛化,而不是重复使用问题。

**主题选择。** 我们构建了四个遗忘主题,涵盖历史事件和涉及公众人物的敏感案例,其中两个改编自 [43](从头生成问题)。**挑战者号灾难**嵌入在更广阔的任务背景中,使得选择性遗忘困难;**塞勒姆女巫审判**是一个孤立的史实片段,副作用极小;而**史蒂夫·乔布斯医疗**和**布兰妮·斯皮尔斯监护权**案例则要求在保留实体知识的同时忘记敏感细节。这些共同反映了现实场景,即必须忘记特定信息而不损害更广泛的知识。

**与先前基准的关系。** 现有基准在非对称泛化问题的两侧各留有一个缺口。

首先,遗忘评估未能测试强化泛化——压制是否在所有措辞和同一目标事实的推理路径下保持。LKF [43] 仅探测训练问题的改述,而 RWKU [19] 添加的反向和同义词变体并未基于特定事实。关键在于,改述探针错过了推理性泄露:[48] 表明遗忘的事实可以通过相关信息持续存在,并在间接推理下重新浮现,但仅覆盖了 YAGO [29] 关系,而非一般事实。

其次,保留评估未能测试广泛泛化——保持知识是否跨越语义、句法和词汇变体。

相似文章

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。