衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL 论文

摘要

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。

arXiv:2608.11408v1 Announce Type: new 摘要:先前的白盒研究表明,大型语言模型在遗忘后仍可能保留目标知识的潜在痕迹,即使这些知识不再在其输出中表达。然而,现有审计仍局限于一次性诊断:尚不清楚这些残余信号能否预测持续训练下的未来恢复,或能否作为可靠的优化目标。弥合这一差距对于确定内部审计能否超越事后评估,转向主动风险监控和更安全的遗忘至关重要。我们提出了J-Access,一种使用雅可比透镜的推理时审计方法,将中间表示映射到词汇空间,并衡量目标概念在模型输出路径上保持可访问的频率。我们假设残余可访问性反映了恢复敏感性:距离输出路径更近的知识需要更少的微调即可恢复,从而导致更快的恢复。我们对涵盖八种遗忘方法的398个公开遗忘模型进行了审计。我们发现:(1)大多数遗忘模型的访问水平仍高于仅保留(retain-only)的黄金水平;(2)攻击前的可访问性在模型层面预测恢复速度和程度,但无法识别哪些具体事实会被恢复;(3)直接最小化J-Access并不能促进真正的删除。相反,模型学会了向审计隐藏知识,产生更低的审计分数,但攻击后恢复程度更大。这些发现将J-Access定位为评估遗忘模型中残余敏感性的模型级诊断工具。我们认为,内部审计应作为遗忘评估中一个独立的诊断维度,且不应在未经验证的情况下转化为优化目标。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:26

# 衡量,而非优化:预测 LLM 遗忘中的恢复

来源:https://arxiv.org/html/2608.11408

Huaxing Liu、Xiang Wang、Shuai Li、Xinye Li、Lang Gao、Jinghui Zhang、Zheng Lu、Fengxian Ji、Xiaojun Chang、Xiuying Chen

致谢:通讯作者。

###### 摘要

先前的白盒研究表明,大型语言模型(LLM)在经历机器遗忘后,即使目标知识不再出现在输出中,仍可能在隐藏状态中保留潜在痕迹。然而,现有审计仍局限于一次性诊断:目前尚不清楚这些残余信号能否预测持续训练下的未来恢复,或能否作为可靠的优化目标。弥合这一空白,对于确定内部审计能否从事后评估走向主动风险监测和更安全的遗忘至关重要。我们提出 **J-Access**,一种推理时审计方法,利用 Jacobian 透镜将中间表示映射到词表空间,并衡量目标概念在模型输出路径上仍可被访问的频率。我们假设残余可访问性反映了恢复敏感性:越接近输出路径的知识,恢复所需的微调越少,恢复也越快。我们对涵盖八种遗忘方法的 398 个公开遗忘模型进行了审计。我们发现:(1)大多数遗忘模型保留的访问水平高于仅保留数据训练的金标模型;(2)攻击前的可访问性可以在模型层面预测恢复速度和恢复程度,但无法识别哪些具体事实会被恢复;(3)直接最小化 J-Access 并不能促进真正的删除。相反,模型学会了向审计隐藏知识,产生更低的审计分数,但攻击后的恢复反而更大。这些发现将 J-Access 定位为评估遗忘模型中残余敏感性的模型级诊断工具。我们认为,内部审计应作为遗忘评估中一个独立的诊断维度,且在没有验证的情况下不应被转化为优化目标。

## 引言

越来越多的白盒研究发现,大型语言模型(LLM)在经历机器遗忘后,即使目标知识不再出现在模型输出中,仍可能在隐藏状态和参数中保留“被遗忘”知识的痕迹(Patil, Hase, and Bansal 2024 (https://arxiv.org/html/2608.11408#bib.bib30);Lynch et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib27);Hong et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib19);Hong et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib18);Lee, Kim, and Jo 2026 (https://arxiv.org/html/2608.11408#bib.bib23);Song et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib35);Wang et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib38))。这一发现挑战了遗忘评估的主流实践:一种遗忘方法是否成功,通常仅在行为层面被认证,即通过测量遗忘集上的答案概率、文本重叠、真实比例、问答性能和成员推断泄漏来衡量(Maini et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib28);Shi et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib33);Cao et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib5);Dorna et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib8);Gao et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib13))。我们将这种基于输出的评估所认定的成功称为行为遗忘(Yang et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib39);Song et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib36);Lee, Kim, and Jo 2026 (https://arxiv.org/html/2608.11408#bib.bib23))。这些结果表明,模型所表达的并不总是反映其所保留的,从而削弱了“行为遗忘通常等同于真正删除”这一假设。

图 1:J-Access 能预测未来的恢复风险,但作为直接优化目标却会失败。更高的攻击前 J-Access 预示着更大的模型级恢复,而直接最小化它可以在不删除潜在知识的情况下降低审计分数。

然而,仅检测到残余痕迹并不能确立其实际意义,因为现有的白盒审计只提供单一时间点的快照。这一局限引出了两个实际问题。首先,残余信号能否预测持续训练下知识的未来恢复?这种预测有效性对于区分暂时抑制与稳定遗忘、比较不同遗忘方法带来的长期风险,以及判断该信号在模型层面还是实例层面可靠,都是必要的。其次,这些信号在被直接优化时是否仍然可靠?如果内部审计要指导训练,这种稳健性至关重要,因为模型可能学会抑制被测量的信号,而不真正删除潜在知识。如图 1 (https://arxiv.org/html/2608.11408#Sx1.F1) 所总结,我们在两种设置下评估内部审计:作为未来恢复的独立预测器,以及作为训练中的直接优化目标。

为回答这些问题,我们提出 **J-Access**,一种推理时审计方法,利用 Jacobian(Jacobi 1841 (https://arxiv.org/html/2608.11408#bib.bib21))透镜来操作化“目标知识与模型输出路径之间的内部距离”这一概念。具体而言,对于每个隐含被遗忘实体但不直接点名该实体的探针查询,我们通过 Jacobian 透镜将来自中后层一带的中层残差表示映射到词表空间,并检查与目标概念相关的任何 token 是否出现在排名靠前的解码 token 中;得到的访问率会针对仅保留数据训练的金标模型和原始未遗忘模型进行归一化。该读出机制建立在近期可解释性工作的基础上,这些工作将此类中层表示识别为可言语化内容的功能性“工作区”,并通过引导(steering)和修补(patching)实验对该读出进行了因果验证(Gurnee et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib17))。这一设计天然适合回答未来恢复能否被预测的问题:重学习攻击本质上是通过少量微调,重新连接那些已经存在但暂时与输出路径断开的知识。知识越接近输出路径,重新打开它所需的微调就越少,恢复发生得就越快、越彻底。

我们在 TOFU 基准(Maini et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib28))和 OpenUnlearning(Dorna et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib8))上进行实验,涵盖八种遗忘方法和 398 个公开遗忘模型。我们报告三项主要发现。第一,大多数遗忘模型(包括那些通过标准遗忘和效用标准的模型)对目标知识的内部访问水平仍远高于仅保留数据训练的金标模型,表明行为遗忘并不等于内部擦除。第二,在跨实体重学习攻击中,攻击前的 J-Access 能预测模型层面的恢复速度,但不能预测哪些具体条目会恢复。第三,在遗忘过程中直接抑制 J-Access 分数会降低审计分数,但会增加攻击后的恢复,表明模型学会的是逃避审计,而非真正删除目标知识。

## 相关工作

#### LLM 遗忘方法。

机器遗忘起源于确切的重新训练方案,如 SISA(Bourtoule et al. 2020 (https://arxiv.org/html/2608.11408#bib.bib3))和经认证的移除保证(Guo et al. 2023 (https://arxiv.org/html/2608.11408#bib.bib15)),但这些方案无法扩展到 LLM 训练流程,因此近似目标占据主导。基于优化的遗忘会提升遗忘集上的损失(Jang et al. 2023 (https://arxiv.org/html/2608.11408#bib.bib22)),并通过保留侧正则化使其稳定,如 GradDiff(Maini et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib28))。偏好式目标如 NPO、SimNPO 和 AltPO 将遗忘重新定义为拒绝或替换目标答案(Zhang et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib40);Fan et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib11);Mekala et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib29));拒绝目标训练将遗忘查询映射到弃权(Maini et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib28));UNDIAL 对调整后的 logits 进行自蒸馏(Dong et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib7));RMU 则对有害数据上的中间表示进行扰动(Li et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib24))。Eldan and Russinovich 2023 (https://arxiv.org/html/2608.11408#bib.bib9) 开创了对预训练内容的近似遗忘,Liu et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib25) 对这一快速发展的领域进行了综述。我们对其中八种方法的已发布检查点进行审计,并探究它们的行为成功掩盖了什么。

#### 遗忘的行为评估。

TOFU 针对虚构作者,以仅保留数据训练的金标参考模型为基准,对遗忘效果进行评分(Maini et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib28));MUSE 评估逐字记忆、知识、隐私泄漏和效用(Shi et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib33));WMDP 通过多选题衡量危险能力(Li et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib24));RWKU 将评估扩展到真实世界实体和对抗性提示(Cao et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib5))。OpenUnlearning 整合了方法和指标,包括我们用作基线的成员推断攻击,并发布了我们所审计的遗忘模型(Dorna et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib8))。近期的批评认为,这类基准对进展的衡量是薄弱的,因为抑制可以伪装成遗忘(Thaker et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib37);Gao et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib13))。所有这些工作都通过模型输出来认证遗忘;没有一项考察目标知识在内部是否仍可访问,或这种残余访问是否携带关于未来恢复的任何信息。

#### 遗忘模型的白盒审计。

先前的工作表明,行为遗忘并不等于内部擦除。残余知识可以在隐藏状态中被检测到(Patil, Hase, and Bansal 2024 (https://arxiv.org/html/2608.11408#bib.bib30);Lynch et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib27)),可以通过激活修补或参数恢复进行定位(Hong et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib19)),通过参数痕迹进行量化(Hong et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib18)),并通过激活引导加以恢复(Seyitoğlu et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib32))。与我们的工作最接近的是 UDS,它使用两阶段激活修补来衡量内部擦除(Lee, Kim, and Jo 2026 (https://arxiv.org/html/2608.11408#bib.bib23))。然而,这些审计仅在同一个检查点上针对行为进行验证。它们的信号能否预测未来的重学习,或在直接优化下是否仍然可靠,仍是未知数。这一担忧得到如下证据的支持:潜在空间防御可以通过激活混淆被规避(Bailey et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib1)),这与代理目标在更广泛意义上容易遭受过度优化是一致的(Gao, Schulman, and Hilton 2022 (https://arxiv.org/html/2608.11408#bib.bib12))。

为弥补这些空白,我们直接将残差表示解码到词表空间,建立在 logit lens 及其改进版本的基础之上(Belrose et al. 2023 (https://arxiv.org/html/2608.11408#bib.bib2);Ghandeharioun et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib14))。具体而言,我们采用 Jacobian 透镜(Gurnee et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib17)),因为遗忘可能会移动表示,从而违背直接去嵌入所依赖的共享基假设。相关的读出方法也已揭示模型未明确言语化的潜在知识(Burns et al. 2022 (https://arxiv.org/html/2608.11408#bib.bib4);Ryd et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib31))。利用这一读出方法,我们从两个此前未探索的维度评估白盒审计:前瞻有效性(prospective validity)和直接优化下的稳健性。

#### 重学习与其他恢复攻击。

少量 epoch 的微调可以恢复“被遗忘”的知识(Hu et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib20);Deeb and Roger 2024 (https://arxiv.org/html/2608.11408#bib.bib6);Łucki et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib26));被遗忘的内容也可以通过上下文重新引入(Shumailov et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib34));低比特量化本身就能通过擦除遗忘所施加的微小权重更新来恢复其中大部分内容(Zhang et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib41))。近期方法旨在抵抗此类攻击(Fan et al. 2025 (https://arxiv.org/html/2608.11408#bib.bib10);Guo et al. 2024 (https://arxiv.org/html/2608.11408#bib.bib16))。先前的工作使用这些攻击来证明特定方法会失败;我们则相反,使用重学习——攻击规则和成功标准事先固定——作为验证标准,并据此对内部审计的预测进行评分。

参见图注

图 2:行为遗忘并不等于内部擦除。在 398 个遗忘模型中,大多数保留的目标可访问性高于仅保留数据训练的金标模型,其中也包括许多行为上成功的检查点。J-Access 在不同遗忘方法之间以及同一方法内部都存在显著差异。每个面板以蓝色突出显示一种方法;圆圈表示行为成功;虚线和点线分别表示原始模型和金标模型。

## J-Access 审计

### 符号

一个参数为 θ₀ 的模型在 D = Dr ∪ Df 上训练,其中 Df 是遗忘集,Dr 是保留集;遗忘算法使用 Df、Dr 将 θ₀ → θu;金标参考模型 θg 仅在 Dr 上训练。审计探针 xi 是一个查询,它隐含了遗忘集实体但不包含目标答案;其概念 token 集 Ci 收集了能够表达目标关联的 token。我们使用两种粒度:主要身份层级,即被隐含实体的全名和名称片段 token;以及次级知识层级,它将 Ci 扩展到答案内容词,并应用文档频率和可推断性过滤,细节见附录 A。

### Jacobian 透镜

我们的审计要回答的问题是:即使模型在其输出中不表达某个目标关联,该关联是否仍然存在于模型的中间表示中。为了衡量这种可访问性,我们需要一种读出方法,用来估计模型的后续层会将某个中间表示转换为怎样的词表级证据。如 logit lens 那样直接将去嵌入矩阵应用于中间状态,需要假设中间层表示和最终层表示共享一个共同基。这一假设在遗忘之后可能变得不可靠,因为遗忘可能改变残差流的几何结构,却并未移除底层关联。因此,我们使用 Jacobian 透镜(Gurnee et al. 2026 (https://arxiv.org/html/2608.11408#bib.bib17))。

相似文章

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。

遗忘算法审计

arXiv cs.LG

提出一种实用的审计器,利用成员推理攻击来计算遗忘参数ε的数据依赖下界,发现经过认证的算法(如模型裁剪、回退删除)与经验方法(如基于Hessian的遗忘、梯度上升)之间有明显差异:前者达到严密的下界,后者表现出较大的下界,表明遗忘效果不佳。

通过激活修补测量大语言模型遗忘深度

arXiv cs.CL

论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。

无奖励的表征:JEPA对LLM微调的审计

arXiv cs.LG

本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。