通过激活修补测量大语言模型遗忘深度
摘要
论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。
arXiv:2605.24614v1 公告类型:新
摘要:大语言模型遗忘已成为隐私保护和AI安全的关键事后机制,但审计目标知识是否被真正擦除仍具挑战性。现有的输出级指标无法检测这些知识是否能从内部表示中恢复。最近的白盒研究揭示了此类残留知识,但通常依赖于辅助训练或数据集特定适配,缺乏通用指标。为解决这些局限,我们提出了遗忘深度评分(UDS),一种通过激活修补量化遗忘的机制深度的指标。UDS首先使用保留模型基线识别编码目标知识的层,然后在0-1尺度上衡量被遗忘模型擦除的程度。在涵盖8种方法的150个遗忘模型的20个指标的元评估中,UDS实现了最高的忠实度和鲁棒性,证实了我们的因果方法是遗忘评估最可靠的方法。案例研究进一步揭示,白盒指标在层级别可能不一致,且擦除深度因示例而异。我们提供了将UDS集成到现有基准框架并简化评估流程的指南。代码和数据可在 https://github.com/gnueaj/unlearning-depth-score 获取。
查看缓存全文
缓存时间: 2026/05/26 09:04
# 通过激活修补度量 LLM 遗忘深度 来源:https://arxiv.org/html/2605.24614 Jaeung Lee, Dohyun Kim, Jaemin Jo 成均馆大学 韩国 \{dlwodnd00, kimdoh0423, jmjo\}@skku\.edu ###### 摘要 大语言模型 (LLM) 遗忘已成为隐私保护和 AI 安全的关键事后机制,然而审核目标知识是否真正被擦除仍然具有挑战性。现有的输出级指标无法检测到这些知识何时可以从内部表示中恢复。最近的白盒研究揭示了这种残余知识,但通常依赖于辅助训练或特定数据集的适配,缺乏可泛化的指标。为了解决这些局限性,我们提出了**遗忘深度分数 (UDS)**,这是一种通过激活修补量化遗忘机制深度的指标。UDS 首先使用保留模型基线确定编码目标知识的层,然后在 0–1 尺度上测量未学习模型中该知识被擦除的程度。在涵盖 8 种方法的 150 个未学习模型的 20 个指标的元评估中,UDS 实现了最高的忠实性 (AUC-ROC 0.971) 和鲁棒性 (HM 0.932),证实了我们的因果方法是最可靠的遗忘评估方法。案例研究进一步揭示,白盒指标可能在层级别产生分歧,且擦除深度因示例而异。我们提供了将 UDS 集成到现有基准框架和简化评估流程的指南。¹¹代码和数据可在 https://github.com/gnueaj/unlearning-depth-score 获取。
## 1 引言
大语言模型 (LLM) 会记住其大部分训练数据(Tirumala et al., 2022 (https://arxiv.org/html/2605.24614#bib.bib31)),当这些数据包含敏感个人信息或危险知识时,会对隐私和 AI 安全构成风险(Carlini et al., 2021 (https://arxiv.org/html/2605.24614#bib.bib4); Bengio et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib2))。LLM 遗忘通过从已训练模型中移除目标知识,同时保留其一般能力来应对这一问题(Jang et al., 2023 (https://arxiv.org/html/2605.24614#bib.bib14))。目标是产生一个与完全在没有目标数据的情况下训练的模型无法区分的模型(Bourtoule et al., 2021 (https://arxiv.org/html/2605.24614#bib.bib3)),并且越来越多的方法正在追求这一目标(例如,Jang et al., 2023 (https://arxiv.org/html/2605.24614#bib.bib14); Zhang et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib36); Li et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib20))。然而,一个基本问题仍然存在:*我们如何验证知识是否被真正移除?*
最近的基准测试工作已致力于系统评估现有方法(Maini et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib22); Shi et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib30); Li et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib20))并进行可视化比较(Lee et al., 2026 (https://arxiv.org/html/2605.24614#bib.bib19)),主张可靠的指标应具有**忠实性**(检测知识的准确性)和**鲁棒性**(在干预下的稳定性)(Dorna et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib6))。虽然这些基准框架主要依赖于基于输出的指标,但对手可以通过轻量级微调(Fan et al., 2025a (https://arxiv.org/html/2605.24614#bib.bib7))或激活操作(Seyitoğlu et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib28); Jang et al., 2026 (https://arxiv.org/html/2605.24614#bib.bib15))来恢复看似被擦除的知识。这种脆弱性表明评估必须超越输出 logits,从而促使多项研究探索白盒分析以识别残余知识(Hong et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib13); Lynch et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib21); Guo et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib11))。然而,当前的白盒方法通常需要辅助训练或绑定到特定数据集,缺乏用于系统方法比较的可泛化分数。
为了解决这些局限性,我们提出了**遗忘深度分数 (UDS)**,这是一种免训练、因果且与数据集无关的指标,通过激活修补量化遗忘的机制深度。我们将*深度*定义为遗忘渗透到模型内部的程度,而不仅仅是改变最终输出。UDS 分两个阶段运行:(1) 基线阶段,通过将保留模型(即未在目标数据上训练的模型)的隐藏状态修补到完整模型(即在包括目标的所有数据上训练的模型)中来识别编码知识的层,(2) 量化阶段,将未学习模型的隐藏状态修补到完整模型中,以测量编码知识中有多少仍然存在。与先前的诊断分析不同,UDS 进行因果干预以测试知识是否可恢复,从而产生从 0(完整)到 1(擦除)的每示例分数,反映跨层的擦除深度。
在我们对涵盖 8 种方法的 150 个未学习模型的 20 个指标进行的全面元评估中,UDS 实现了最高的忠实性 (AUC-ROC 0.971) 和鲁棒性 (HM 0.932),优于输出级指标和白盒基线。我们的案例研究表明,因果评估可以揭示因表示偏移而掩盖残余知识(从而误导观测指标)的情况,并且擦除深度在单个方法内的不同示例间有所不同。最后,我们提供了将 UDS 集成到现有框架和简化评估流程的指南。
总结而言,我们的贡献如下:
- • **遗忘深度分数 (UDS)**,一种通过两阶段激活修补量化遗忘机制深度的指标。
- • 对覆盖 8 种方法的 150 个未学习模型进行的 20 个指标的元评估,证明我们的因果方法最可靠地评估了知识擦除。
- • 案例研究揭示了因表示偏移而掩盖残余知识(从而误导观测指标)的情况,并附有每示例分析以及将 UDS 集成到现有基准框架的指南。
## 2 背景与相关工作
### 2.1 LLM 遗忘
给定一个已训练的模型、一个遗忘集 \(D_f\) 和一个保留集 \(D_r\),机器遗忘的目标是产生一个与仅在 \(D_r\) 上训练的模型无法区分的模型(Bourtoule et al., 2021 (https://arxiv.org/html/2605.24614#bib.bib3)),同时保留一般能力(Yao et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib33))。
#### 方法。
最简单的方法,梯度上升(Jang et al., 2023 (https://arxiv.org/html/2605.24614#bib.bib14)),最大化在 \(D_f\) 上的损失,但无约束优化会导致灾难性崩溃。GradDiff(Yao et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib33); Maini et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib22)) 通过在 \(D_r\) 上联合最小化损失来缓解这一问题,尽管平衡相反的梯度仍然脆弱。NPO(Zhang et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib36)) 通过偏好优化重新定义了这一张力,将遗忘集完成视为不偏好,而 SimNPO(Fan et al., 2025b (https://arxiv.org/html/2605.24614#bib.bib8)) 通过移除参考模型并按响应长度归一化来简化这一点。IdkNLL 和 IdkDPO(Maini et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib22)) 则训练模型产生替代回答(例如“我不知道”),而 AltPO(Mekala et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib23)) 通过域内正面反馈扩展了这一点。RMU(Li et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib20)) 在表示层面进行干预,将隐藏状态导向随机目标,而 UNDIAL(Dong et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib5)) 使用调整后 logits 的自蒸馏将输出分布引导远离 \(D_f\)。通过超参数扫描使用这些方法遗忘的模型构成了我们在 §4 中指标比较的评估池。
#### 评估框架。
遗忘通常沿着三个轴进行评估:**记忆**(模型是否仍能再现遗忘集知识);**隐私**(对手是否能检测到模型在 \(D_f\) 上训练过);以及**效用**(一般性能是否保持)。像 TOFU(Maini et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib22))、MUSE(Shi et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib30)) 和 WMDP(Li et al., 2024 (https://arxiv.org/html/2605.24614#bib.bib20)) 等基准解决了这些问题,而 OpenUnlearning(Dorna et al., 2025 (https://arxiv.org/html/2605.24614#bib.bib6)) 将它们整合到统一框架中。OpenUnlearning 还引入了元评估,通过两个标准评估指标本身的可靠性:**忠实性**(指标是否能区分有/无遗忘集知识的模型)和**鲁棒性**(在量化、微调等干预下是否保持稳定)。我们扩展了这一框架,引入了一个对称的鲁棒性标准。与原始仅惩罚知识恢复的公式不同,我们的对称公式均匀评估任一方向的不稳定性(参见 §4.1)。
### 2.2 LLM 遗忘的白盒评估
除了输出级评估之外,各种技术可以探测模型内部。CKA(Kornblith et al., 2019 (https://arxiv.org/html/2605.24614#bib.bib18)) 比较跨层的表示几何,Logit Lens(nostalgebraist, 2020 (https://arxiv.org/html/2605.24614#bib.bib25)) 通过模型的预测头解码中间隐藏状态,Fisher Information(Kirkpatrick et al., 2017 (https://arxiv.org/html/2605.24614#bib.bib17)) 量化参数对特定数据的敏感性,而激活修补(Meng et al., 2022 (https://arxiv.org/html/2605.24614#bib.bib24)) 通过在模型之间修补隐藏状态来因果测试知识。
将这些技术应用于遗忘,几项研究表明看似遗忘的模型在内部保留了遗忘集知识。Xu et al. (2025 (https://arxiv.org/html/2605.24614#bib.bib32)) 使用 CKA 和 Fisher 诊断来表征遗忘在跨层的可逆性。Lynch et al. (2024 (https://arxiv.org/html/2605.24614#bib.bib21)) 在隐藏状态上训练探针来检测输出指标不可见的潜在知识。Guo et al. (2025 (https://arxiv.org/html/2605.24614#bib.bib11)) 使用因果追踪定位事实回忆电路,然后用训练好的探针确认残余知识。Hong et al. (2025 (https://arxiv.org/html/2605.24614#bib.bib12)) 将 MLP 值向量投影到词汇空间,表明参数化知识痕迹在遗忘后仍然存在。Patil et al. (2024 (https://arxiv.org/html/2605.24614#bib.bib26)) 应用 logit lens 投影显示中间层仍然解码出据称被擦除的知识。Hong et al. (2024 (https://arxiv.org/html/2605.24614#bib.bib13)) 使用参数恢复表明,基于微调的遗忘只修改了最终层的 MLP 系数分数,而没有改变底层值向量,因此存储的知识保持完整。
这些研究揭示了残余知识,但它们主要是诊断性的:没有一个提供标准化、可比较的分数,能够跨遗忘集泛化(表1)。UDS 通过一个免训练、因果、与数据集无关的分数来解决这一问题,用于系统的方法比较(参见 §3)。
| 工作 | 免训练 | 因果 | 数据无关 | 分数 |
|------|--------|------|----------|------|
| Lynch et al. (2024) | ✗ | ✗ | ✓ | ✗ |
| Guo et al. (2025) | ✗ | △ | ✗ | ✗ |
| Hong et al. (2025) | ✓ | △ | ✗ | ✗ |
| Patil et al. (2024) | ✓ | ✗ | ✓ | ✗ |
| Hong et al. (2024) | ✓ | ✓ | ✗ | ✓ |
| UDS (本文) | ✓ | ✓ | ✓ | ✓ |
表1:白盒遗忘分析比较。**免训练**:无需辅助训练。**因果**:因果评估知识(△ = 因果定位但观测评估)。**数据无关**:可直接应用于新遗忘集。**分数**:提出量化残余遗忘集知识的指标。
## 3 遗忘深度分数
参考标题
图1:单次遗忘集示例的 UDS 概述。(A) 阶段 1 将 \(M_{\text{ret}}\) 的隐藏状态修补到 \(M_{\text{full}}\) 的每一层,以衡量遗忘集知识被编码的深度。(B) 阶段 2 以 \(M_{\text{unl}}\) 作为源重复此过程,量化有多少编码的知识仍然可恢复。(C) 将阶段 2 的退化与阶段 1 在每一层进行比较,计算擦除比率,然后加权聚合为一个 0-1 分数。
在本节中,我们描述 UDS,这是一种通过激活修补测量遗忘集知识可恢复程度来量化遗忘深度的指标(图1)。我们定义问题设置(§3.1),描述修补过程(§3.2),讨论高效实现策略(§3.3),并跨模型规模验证该指标(§3.4)。附录 D 提供了进一步的消融实验来验证我们的设计选择。
### 3.1 问题设置
#### 术语。
我们考虑三个模型:(i) \(M_{\text{full}}\),在完整数据集 \(D_r \cup D_f\) 上训练;(ii) \(M_{\text{ret}}\),仅在 \(D_r\) 上训练(遗忘的金标准);以及 (iii) \(M_{\text{unl}}\),通过将遗忘方法应用于 \(M_{\text{full}}\) 获得。遵循 Ghandeharioun et al. (2024 (https://arxiv.org/html/2605.24614#bib.bib9)),我们将提取隐藏状态的模型称为**源**,将接收隐藏状态的模型称为**目标**。
#### 输入与测量。
每个遗忘集示例 \(i\) 由一个输入上下文 \(x_i\) 和一个实体跨度 \(y_i = (y_{i,1}, \dots, y_{i,T_i})\) 组成。我们关注实体跨度,因为常见的模板短语无论知识保持如何都是可预测的。为了避免生成噪声并允许在模型间进行稳定的每令牌比较,我们使用教师强制:完整输入序列在一次前向传播中提供。模型基于真实前缀 \(y_{i,<t}\) 和上下文 \(x_i\) 预测每个实体令牌 \(y_{i,t}\)。我们使用预测标记的 logit 值作为度量,但不使用最大概率,而是测量目标令牌 \(y_{i,t}\) 的 logit。这捕获了模型对该特定令牌的置信度,同时避免了来自未受干扰模型的最大 logit 优势(这可能导致对错误令牌的高置信度)。
#### 修补。
对于具有 \(L\) 层的 Transformer,用 \(M^{\text{src}}_\ell(x)\) 表示当输入序列 \(x\) 在**源**模型中前向传播时,在第 \(\ell\) 层之后获得的隐藏状态。激活修补通过用源模型的隐藏状态替换目标模型在特定层 \(\ell\) 的隐藏状态来执行。然后目标模型继续其前向传播直至输出。对于一个示例 \(i\),我们修补每一层 \(\ell\),得到输出 logits \(s^{S1}_{i,\ell}\) 和 \(s^{S2}_{i,\ell}\)。
### 3.2 两阶段修补过程
#### 阶段 1:基线。
目标是识别对遗忘集知识关键的层。我们将 \(M_{\text{ret}}\) 作为源,\(M_{\text{full}}\) 作为目标。对于每个层 \(\ell\),我们修补并测量预测退化:
\[
\Delta^{S1}_{i,\ell} = \frac{1}{T_i} \sum_{t=1}^{T_i} \bigl( s^{\text{full}}_{i,t} - s^{S1}_{i,t} \bigr)
\]
(1)
这里 \(s^{\text{full}}_{i,t}\) 是未受干扰的 \(M_{\text{full}}\) 对令牌 \(y_{i,t}\) 的 logit。如果层 \(\ell\) 对编码该知识很重要,那么用 \(M_{\text{ret}}\) 的状态修补它应该会显著降低 logit(即高 \(\Delta^{S1}_{i,\ell}\))。不重要层则表现出低退化。
为了消除噪音并聚焦于编码知识的层,我们通过阈值化 \(\Delta^{S1}_{i,\ell}\) 来定义一个关键层集合 \(\text{KE}_i\):
\[
\text{KE}_i = \{\ell : \Delta^{S1}_{i,\ell} > \tau\}, \quad \tau = 0.05
\]
(2)
这还将层擦除比率(式 4)中的分母 \(\Delta^{S1}_{i,l}\) 限制在远离零的位置。
#### 阶段 2:量化。
我们用 \(M_{\text{unl}}\) 作为源重复相同的过程,量化有多少知识仍然可恢复:
\[
\Delta^{S2}_{i,\ell} = \frac{1}{T_i} \sum_{t=1}^{T_i} \bigl( s^{\text{full}}_{i,t} - s^{S2}_{i,t} \bigr)
\]
(3)
如果遗忘在层 \(\ell\) 对于示例 \(i\) 擦除了知识,那么修补 \(M_{\text{unl}}\) 应该与修补 \(M_{\text{ret}}\) 一样相似文章
MLUBench: 多模态大语言模型终身遗忘评估基准
MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。
PreUnlearn:在大语言模型遗忘前审计附带知识损害
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。
模型遗忘目标因语言功能不同而异
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。
抵御重学攻击的鲁棒大语言模型遗忘:表征中的次要分量至关重要
本文介绍了次要分量遗忘(MCU),这是一种针对大语言模型遗忘的新颖方法,通过靶向表征中的次要分量来抵御重学攻击。它通过关注模型谱结构中的鲁棒方向,解决了现有方法的脆弱性问题。
面向网络防御的大模型遗忘:方法、挑战与新兴威胁综述
本综述探讨了面向网络防御的大模型遗忘方法,引入了一个三级框架来区分行为抑制、表示级衰减和真正遗忘,并分析了基于梯度、基于影响和局部编辑的方法。