Cascade:大语言模型遗忘的分层可恢复性控制
摘要
Cascade 是一个用于大语言模型遗忘的分层框架,通过多层控制最小化可恢复性,在保持效用的同时减少中间表示中的残留知识,从而改进了现有方法。
arXiv:2609.16890v1 公告类型:新
摘要:大语言模型(LLM)遗忘对于在保持通用效用的同时移除敏感或受版权保护的知识至关重要。现有方法经常在中间表示中留下残留知识,这些知识仍然可以被恢复。为了解决这个问题,我们提出了 Cascade,一个分层的可恢复性控制框架,它最小化目标知识的内在可识别性。Cascade 结合了三种互补控制:路径级路由以抑制与隐私相关的激活路径,表示级压缩以减少几何可分性,以及解码级干预以限制残留恢复。在 TOFU、MUSE-News 和 WMDP 上的实验,包括使用查询重构和提取式提示的鲁棒性测试,表明 Cascade 有效减少了可恢复性,同时保持了稳定的模型效用。
查看缓存全文
缓存时间: 2026/09/16 08:54
# Cascade:大型语言模型遗忘的层级可恢复性控制
来源:https://arxiv.org/html/2609.16890
Qingchen Yu1,2、Shiying Duan1,2、Xiaodong Li3、Yuhua Wang1,2、Zhiyu Li4、Shiji Zhou1,2、Yifan Sun3,†、Zhaoxin Fan1,2,†
1 北京航空航天大学 区块链与隐私计算高级创新中心
2 北京航空航天大学 人工智能学院
3 中国人民大学 统计学院 应用统计中心
4 MemTensor(上海)科技有限公司
† 通讯作者
###### 摘要
大型语言模型(LLM)的遗忘对于在保留通用功能的同时移除敏感或受版权保护的知识至关重要。现有方法通常在中间表示中留下残留知识,这些知识仍可能被恢复。为此,我们提出 **Cascade**——一个层级化可恢复性控制框架,旨在最小化目标知识的内部可识别性。Cascade 结合了三种互补控制:路径级路由抑制隐私相关激活路径,表示级压缩降低几何可分性,以及解码级干预限制残留恢复。在 TOFU、MUSE-News 和 WMDP 数据集上的实验(包括针对查询重述和提取式提示的鲁棒性测试)表明,Cascade 在保持模型功能稳定的同时,有效降低了可恢复性。
111代码:github.com/Noryxen/Cascade (https://github.com/Noryxen/Cascade)
## 1 引言
大型语言模型(LLM)已成为搜索、编程辅助、教育、科学研究和医疗等应用的基础设施 (Achiam et al., 2023; Singhal et al., 2023; Guo et al., 2025; Yu et al., 2025)。然而,其训练语料库可能包含敏感信息、受版权保护的内容或有害知识,引发了隐私、版权和安全方面的担忧 (Zhang et al., 2025; Yao and Xu, 2024; Kassem et al., 2023; Eldan and Russinovich, 2023)。先前的研究表明,语言模型可以记忆训练数据,并在提示或提取攻击下泄露这些数据 (Li et al., 2024b; Li et al., 2026)。由于从净化后的语料库重新训练 LLM 成本过高,LLM 遗忘旨在从训练好的模型中移除指定数据或知识的影响,同时保持其在非目标数据上的效用 (Maini et al., 2024; Li et al., 2024a; Shi et al., 2025)。参见标题图1:输出抑制不能保证遗忘。目标知识可能通过可激活的路径、可分的表示和重述后仍可解码的输出,在内部保持可恢复性。
现有的 LLM 遗忘方法通常通过训练后优化、模型编辑或推理时干预来降低目标知识的行为影响 (Dong et al., 2025; Vasilev et al., 2025; Pawelczyk et al., 2024; Pu et al., 2026; Wang et al., 2026)。这些方法在降低目标答案的似然性、减少直接记忆以及保持保留集性能方面取得了实质性进展 (Maini et al., 2024; Shi et al., 2025; Cao et al., 2024)。然而,它们中的大多数仍然主要通过输出行为来评估遗忘:如果模型不再直接产生目标答案,则认为目标知识已被遗忘。这种观点忽视了一个关键的失效模式:目标知识可能不再在直接生成中暴露,但仍可能在内部保持可激活、可分离和可解码的状态。因此,在语义重述、间接问题、上下文线索或提取式提示下,相同的知识可以被重新访问和恢复 (Dorna et al., 2026; Ozdayi et al., 2023; Nasr et al., 2025; Jiang et al., 2026a; Jiang et al., 2026b)。图1展示了这种残留恢复途径。一个已遗忘的模型可能拒绝原始查询,但在重述、线索式或提取式提示下却能恢复相同的目标知识。这种失败表明,即使直接输出概率被抑制,知识在内部仍保持可激活、可分离和可解码的状态。我们将这种性质称为*内部可识别性*:目标知识仍能从模型中间状态被检测、区分或恢复的程度 (Luan et al., 2026)。因此,有效的遗忘应降低在激活路径、表示空间和解码过程中的可识别性,而不仅仅是抑制目标答案的似然性。
Cascade 在目标知识的恢复链上,沿三个层面进行干预:
1. **路径级路由**:定位并抑制与目标相关的激活路径;
2. **表示级压缩**:将路径表示映射到双曲空间,并利用其径向结构将待遗忘表示压缩到较小半径区域,从而降低表示分辨率和几何可分性 (Patil et al., 2025; Pal et al., 2025);
3. **解码级干预**:限制残留目标信息恢复为显式输出。
通过联合削弱路径、表示和解码过程中的可恢复性,Cascade 减少了目标知识的内部可识别性,而不仅仅是降低目标答案的概率。
我们在 TOFU (Maini et al., 2024)、MUSE-News (Shi et al., 2025) 和 WMDP (Li et al., 2024a) 上评估了 Cascade,涵盖事实遗忘、现实文本遗忘和安全敏感知识移除,并在 Llama-3.2 (Grattafiori et al., 2024) 和 Qwen3 (Qwen-Team, 2025) 模型系列上进行了实验。我们进一步测试了在查询重述和提取式提示下的目标可恢复性。结果表明,Cascade 在降低目标可恢复性的同时保持了稳定的模型效用,在不同基准和模型规模上实现了稳健的遗忘-效用平衡。机制分析显示,Cascade 稳定地定位并选择性地抑制了与隐私相关的路径,同时将待遗忘表示向双曲空间中的较小半径区域移动,从而削弱了目标知识的内部可识别性。
本工作的主要贡献总结如下:
- 我们将内部可识别性确定为 LLM 遗忘中残留可恢复性的关键来源,它捕获了目标知识在模型内部保持可激活、可分离和可解码的程度。
- 我们提出了 **Cascade**,一个层级化的遗忘框架,将 LLM 遗忘形式化为受限的内部可识别性最小化,通过路径级、表示级和解码级控制来削弱恢复能力。
- 我们在基准、模型系列和重述查询上提供了实证和机制证据,表明 Cascade 在保留效用并重塑待遗忘知识的内部路径和几何结构的同时,降低了目标可恢复性。
## 2 相关工作
LLM 遗忘旨在无需完全重新训练即可从训练好的模型中移除指定数据或知识的影响 (Qiu et al., 2025; Le-Khac and Truong, 2025)。现有方法通常将遗忘形式化为训练后重新优化或模型编辑,包括梯度上升、保留集约束优化、负偏好优化、自蒸馏、基于 KL 的分布匹配和原-对偶约束优化 (Zhang et al., 2024; Yao and Xu, 2024; Dong et al., 2025; Vasilev et al., 2025; Entesari et al., 2025)。这些方法结合了遗忘集和保留集的目标,以在保留模型效用的同时削弱目标知识。近期研究进一步探讨了遗忘强度、效用保留和训练稳定性之间的权衡,并探索了熵最大化、可控目标分布、推理时或上下文遗忘策略 (Sun et al., 2025; Yuan et al., 2025; Pawelczyk et al., 2024; Wang et al., 2025)。
随着评估从固定模板转向语义重述、间接查询和提取式提示,近期研究强调了目标知识是否仍可恢复的问题 (Maini et al., 2024; Cao et al., 2024; Shi et al., 2025)。TOFU、MUSE 和 RWKU 等基准测试表明,标准遗忘集性能与实际恢复风险之间存在差距:模型在原始提示下可能显得已遗忘,但仍可能通过语义相关的输入再现目标信息。为缓解这一问题,另一类工作通过定位参数、神经元、激活路径或中间表示来研究内部机制,并通过选择性剪枝、隐私神经元编辑、敏感性引导更新或表示级干预来削弱目标知识 (Pochinkov and Schoots, 2024; Wu et al., 2023; Jia et al., 2024; Li et al., 2024a)。然而,这些方法大多侧重于局部发现和编辑,没有显式地建模目标知识在计算路径、表示空间和解码过程中的层级可恢复性。相比之下,Cascade 将隐私遗忘形式化为层级化可识别性控制,并联合降低了路径、表示和解码级别的可恢复性。
## 3 方法
参见标题图2:用于层级可恢复性控制的 Cascade 框架。Cascade 将 LLM 遗忘形式化为受限的内部可识别性最小化,并通过路径级路由、双曲表示压缩和解码级控制来削弱目标恢复能力。
### 3.1 问题形式化
隐私遗忘旨在防止从 LLM 中恢复目标私有知识,同时保留其在非隐私数据和通用任务上的效用。
222附录A (https://arxiv.org/html/2609.16890#A1) 总结了方法符号。
令 $\mathcal{D}^- = \{(x^-, y^-)\}$ 表示遗忘集,其中 $y^-$ 是需要遗忘的私有目标响应;令 $\mathcal{D}^+ = \{(x^+, y^+)\}$ 表示保留集。给定初始模型 $f_{\theta_0}$,我们从 $f_{\theta_0}$ 初始化 $f_{\theta}$ 并进行优化,使得 $y^-$ 难以恢复,同时保留 $\mathcal{D}^+$ 上的效用。现有方法通常通过降低遗忘目标的输出概率来实施遗忘。然而,这种输出层面的标准并不能确保移除使恢复成为可能的内部条件 (Qiu et al., 2025; Liu et al., 2025; Le-Khac and Truong, 2025)。私有知识可能仍沿着特定的计算路径被激活,在表示空间中保持几何可分性,或从输出分布中恢复 (Pochinkov and Schoots, 2024)。因此,我们将隐私遗忘视为最小化私有知识的*内部可识别性*。
令 $Z_\theta(x)$ 表示由 $f_\theta$ 对输入 $x$ 诱导的内部表示集合。我们使用内部可识别性来刻画私有知识从这些内部状态保持可恢复或可区分的程度:
$$
\mathcal{I}_{\mathrm{id}}(K^- \mid Z_\theta) = \sup_{a \in \mathcal{A}} \mathbb{E}_{(x^-, y^-) \sim \mathcal{D}^-} \Big[ \operatorname{sim}\big(a(Z_\theta(x^-)), y^-\big) \Big],
$$
其中 $K^-$ 表示待遗忘的私有知识,$\mathcal{A}$ 是可能恢复函数的集合,$\operatorname{sim}(\cdot, \cdot)$ 是任务依赖的相似性度量,其值越大表示对私有目标的恢复能力越强。
在此视角下,隐私遗忘成为一个约束优化问题:
$$
\min_\theta \mathcal{I}_{\mathrm{id}}(K^- \mid Z_\theta) \tag{2} \\
\mathrm{s.t.} \quad \mathcal{U}(\theta) \geq \gamma,
$$
其中 $\mathcal{U}(\theta)$ 表示模型效用,$\gamma$ 是可接受的最低效用水平。直接优化方程2中的可识别性项是困难的,因为它依赖于未知的恢复函数,而该函数可能因攻击策略而异。因此,我们构建了一个层级化的代理目标,通过三个可观测的代理指标来近似可恢复性:路径级激活差异、表示级几何可分性和解码级可恢复性:
$$
\mathcal{I}_{\mathrm{id}}^{\mathrm{sur}}(K^-; \theta) = \lambda_{\mathrm{path}} \mathcal{L}_{\mathrm{path}} + \lambda_{\mathrm{hyp}} \mathcal{L}_{\mathrm{hyp}} + \lambda_{\mathrm{decode}} \mathcal{L}_{\mathrm{decode}} \tag{3}
$$
其中 $\lambda_{\mathrm{path}}$、$\lambda_{\mathrm{hyp}}$ 和 $\lambda_{\mathrm{decode}}$ 控制这三个代理项的相对强度。对于表示级组件,我们使用径向几何相似文章
CASCADE:大语言模型在部署期间的基于案例的持续自适应
本文介绍了 CASCADE,这是一个部署时学习框架,允许大型语言模型通过情境记忆和上下文赌博机优化实现持续自适应,而无需修改模型参数。
PreUnlearn:在大语言模型遗忘前审计附带知识损害
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。
原生可遗忘的大语言模型
该论文提出了NULLs(原生可遗忘的大语言模型),这是一种模型类别,它将特定来源的贡献隔离到稀疏激活的sinks中,同时共享骨干神经元,从而无需重新训练即可干净地遗忘单个数据源,并保持通用语言能力。
大型语言模型能否重塑基础算法?
# 论文页面 - 大型语言模型能否重塑基础算法? 来源:[https://huggingface.co/papers/2604.05716](https://huggingface.co/papers/2604.05716) **在我们让 LLM“遗忘”之后,它们还能从零重塑 Dijkstra、Euclid 等基础算法吗?** 我们 loosely 将 Hassabis 的“爱因斯坦测试”搬到算法领域:先用“反学习”把目标算法从模型中抹去,再检验它能否独立重新发明。最新研究表明 LLM 具备这种潜力。
模型遗忘目标因语言功能不同而异
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。