SAGE:保留感知的后处理清洗最终遗忘向量

arXiv cs.LG 论文

摘要

提出SAGE,一种后处理方法,用于清洗大型语言模型中的最终遗忘向量,在不重新运行遗忘流程的情况下改善保留-遗忘权衡。

arXiv:2606.18309v1 公告类型:新发布 摘要:大型语言模型(LLM)的遗忘旨在移除不期望的知识或行为,同时保留已具备的能力。当前所有遗忘方法都涉及遗忘与保留之间的权衡。我们发现,保留激活偏差也可用于量化遗忘方法对保留性能的损害,且无需考虑遗忘过程的具体实现。这使得我们能够通过后处理方法恢复任何遗忘方法的保留性能。因此,我们提出了一种补充性的后处理设置,用于在无需重新运行原始遗忘流程的情况下清洗最终更新向量。在该设置中,我们设计了SAGE(光谱激活-几何清洗),一种针对最终遗忘更新的源无关修正方法。SAGE从一个小型保留代理中收集真实模块输入,提取其主导激活几何结构,并以闭式解求解一个源锚定的优化目标,从而抑制与高能量保留方向对齐的更新分量,同时保留源方法的遗忘载体。在多种遗忘方法、模型规模和基准测试中,SAGE持续缓解了保留-遗忘权衡,将最终向量的后处理清洗确定为机器遗忘中一个实用且尚未充分探索的方向。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:40

# 保留感知的大模型遗忘后处理:最终遗忘向量的修正
来源:https://arxiv.org/html/2606.18309
张静远1,† 白宇晨1,† 温佩希1 黄哲浩1 何正宝1 田翰林1 程欣文1 冉海音1 黄晓霖1,✉
1上海交通大学图像处理与模式识别研究所

###### 摘要

大型语言模型(LLM)遗忘旨在移除不期望的知识或行为,同时保留已有能力。当前的遗忘方法都涉及遗忘与保留之间的权衡。我们发现,保留激活偏差也可以用来量化遗忘方法对保留能力的损害,而无需考虑遗忘过程的具体实现。这使得我们可以通过事后方式恢复任何遗忘方法的保留性能。因此,我们提出一种互补的事后设置,在无需重新运行原始遗忘流程的情况下,对最终更新向量进行净化。在此设置中,我们设计了SAGE(Spectral Activation-GEometry Sanitization),一种源无关的最终遗忘更新修正方法。SAGE从一个小的保留代理集收集真实模块输入,提取其主导激活几何结构,并以闭式解形式求解一个源锚定的优化目标,从而抑制与高能量保留方向对齐的更新分量,同时保留源方法的遗忘载波。在多种遗忘方法、模型规模和基准测试上,SAGE一致地缓解了保留-遗忘权衡,将最终向量的事后净化确定为机器学习中一个实用且未被充分探索的方向。

## 1 引言

参见图注 图1:整体性能。三角形表示损失驱动方法,正方形表示约束引导方法。数据点在不同模型和遗忘难度上取平均。浅色标记和灰线拟合原始基线;深色标记和红线拟合添加SAGE的方法。大型语言模型(LLMs)[1,13,31,36,37]可能从预训练和微调语料中记忆私人信息、受版权保护内容、有害行为以及其他不期望的数据模式[6,21,33,17,41]。这使得机器遗忘对于安全、隐私和法规合规变得日益重要[19,40,42]。虽然精确重训练在经典机器遗忘中仍然是最干净的遗忘目标,但在现代模型规模下其计算成本过高,从而催生了高效的近似替代方法[3,26]。对于LLMs而言,挑战更大,因为知识以高度分布的表征形式编码,这些表征来自大规模语料库,使得在不引发广泛附带损害的情况下移除目标信息变得困难[4,31]。

近期工作产生了大量近似LLM遗忘方法,包括梯度和目标驱动方法[22,34,11,10,38,43]、偏好式优化[8,23]、表征级或局部参数干预[19,29]、损失重加权方法[33,39]以及任务向量方法[16,7,5,18]。此外,TOFU[22]、MUSE[30]和WMDP[19]等基准测试明确表明,遗忘必须与泄露、效用及保留行为相平衡。基于这些基准,许多轻量级干预方法应运而生,从推理时控制[14,27,15,2]到训练时插件[35,44]。尽管这些方法已表明添加轻量级修正机制可以有效进一步改进遗忘,但其中大多数仍与原始流程的特定阶段紧密耦合:训练时插件必须在优化过程中整合,并依赖于重新运行或修改原始遗忘过程。图2(d)显示,在源遗忘过程中,保留激活偏差急剧上升,而保留能力显著下降,即使遗忘强度已基本稳定。这表明最终的遗忘更新仍未完全具备保留感知能力:部署的更新仍然包含不成比例地扰动保留激活方向的分量,说明通过对已完成的更新本身进行净化来改善保留性能仍有很大空间。这催生了一种解耦的事后设置,其中修正的对象不再是训练动态,而是最终的向量本身。我们试图构建一个净化后的向量,以更好地平衡遗忘和保留,而无需重访原始遗忘过程。

参见图注 图2:提出的SAGE方法概览:(a) 从遗忘基线获取事后更新向量;(b) 从模块级输入激活构建稳定且去噪的保留几何结构;(c) 应用闭式谱净化和放大器得到遗忘模型;(d) 在QA样本上展示保留恢复效果以及保留激活偏差的下降。

因此,我们提出SAGE(Spectral Activation-GEometry Sanitization),一种针对最终遗忘向量的事后净化器。为了构建保留激活基,我们采样一个小型保留校准集,通过无梯度前向传播收集模块级输入激活。为了通过最小化更新在保留输入几何结构上的响应能量来减少输出扰动,我们应用截断奇异值分解(SVD)来识别一个稳定且去噪的低秩子空间。由于源遗忘方法已经针对遗忘目标进行了优化,其最终的参数位移是在事后设置中最直接的遗忘载波。因此,SAGE执行源锚定净化:它使净化后的更新接近原始源更新以保持已学到的遗忘信号,同时抑制产生较大保留激活响应的分量。在目标的闭式解中,具有较大保留奇异能量的方向被更强烈地衰减,而位于主导保留子空间外部的更新分量则基本保留。最后,SAGE应用一个放大器以确保有效的遗忘,遵循模型编辑和遗忘的任务向量观点,其中参数位移的方向决定行为改变的类型,其幅度控制改变的强度[16,5]。

实证结果表明,SAGE在多种源遗忘方法、模型规模和遗忘比例上一致地改善了保留-遗忘权衡,且无需重新运行原始遗忘流程。在TOFU上,平均保留能力提升26.3%,同时遗忘效果更优。这些改进在1B到8B模型上保持稳定,并且随着需要遗忘的内容量增加而更加显著。此外,SAGE平均将模型效用提升2.2%,隐私泄露降低6.2%。其益处进一步扩展到结构化QA式遗忘之外。在MUSE和WMDP-cyber上,SAGE分别将保留能力提升约39.8%和5.2%,同时基本保持遗忘行为。值得注意的是,对于TOFU数据集,SAGE仅使用约3%的完整保留集,即使代理预算更小也能保持稳健。这些结果共同表明,对最终遗忘更新进行事后净化是机器学习中一个实用且未被充分探索的设计维度。我们的主要贡献如下:

- •我们研究了一种实用的事后遗忘设置,以减少保留侧的附带损害,其中源遗忘方法的最终参数更新在训练后进行净化,无需重新运行或修改原始流程。
- •我们提出了SAGE,一种模块级的闭式净化器,它从小型保留集构建保留激活几何结构,并应用奇异值感知的软谱算子来抑制保留响应方向,同时保留遗忘效果。
- •在多种源遗忘方法、模型规模和基准测试上,我们表明SAGE一致地改善了保留能力,同时提升了效用并降低了隐私泄露,且计算资源和时间更少。

## 2 相关工作

### 2.1 LLM遗忘

LLM的机器遗忘源于移除私人、受版权保护或有害知识的需求,而无需从头重新训练[17,41]。由于当今LLM的精确删除通常不可行,近期工作聚焦于近似遗忘以及同时衡量移除和保留的评估协议。TOFU[22]、WMDP[19]、MUSE[30]和OpenUnlearning[9]等基准测试使遗忘-保留权衡成为核心关注点,表明有效遗忘应同时评估保留行为、效用和泄露。

大多数现有方法在优化过程中改进这一权衡。基于梯度和目标的方法直接修改遗忘目标,包括梯度上升[22]、NPO[43]和SimNPO[11];而RMU[19]和LUNAR[29]等表征级方法则干预内部激活或隐藏状态以抑制不期望的知识。近期,提出了轻量级的保留感知插件:GRU[35]在训练期间修正损害保留的更新方向,GU[44]移除与保留梯度子空间对齐的分量。其他轻量级方法,如偏移遗忘[14]、上下文内遗忘[27]和软提示[2],通过在推理时而非模型权重层面发挥作用,降低了对访问的需求。相比之下,SAGE在训练完成后运作,直接净化最终部署的权重更新,而无需修改原始优化循环。

### 2.2 权重空间中的遗忘与保留

我们的工作也与将参数差异视为可编辑权重空间对象的方法相关。任务算术[16]表明,微调差值可以作为任务向量,其加法、减法或缩放可引导模型行为而无需进一步训练。然而,单向量遗忘对微调配置、缩放和候选选择敏感。任务单纯形算术[7]和NegMerge[18]通过多向量聚合提高了鲁棒性。PerTA[5]使用梯度或对角Fisher估计重新缩放任务向量,处理过度遗忘问题。这些方法改进向量选择、合并或参数级合并,以获取稳定或保留友好的遗忘向量。SAGE则接受最终向量,并使用模块级保留激活几何结构对其进行净化。

另一个相关的保留导向文献来自模型编辑。ROME[24]通过局部秩一更新编辑事实关联,MEMIT[25]通过跨层分布更新将此范式扩展到多次编辑。AlphaEdit[12]通过将编辑扰动投影到保留知识键的零空间来减少附带损害。这些文献与我们强调保护未受影响知识的方向一致,但主要针对事实编辑,且通常依赖硬性保留约束。相比之下,遗忘产生的最终更新范围更广,必须减少不安全知识而不必要地损害保留行为。SAGE通过修正最终更新向量本身,将这种保留视角带入遗忘,减少不成比例地干扰保留行为的分量,同时保留原始遗忘效果。

## 3 方法

### 3.1 问题设置

现有遗忘方法在其训练目标、优化过程和访问假设上往往差异很大,但它们共享一个共同挑战:改善遗忘通常以牺牲保留能力为代价。如图2所示,保留侧的附带损害可以通过保留激活偏差反映出来,且与遗忘算法的具体实现细节无关。因此,我们提出一种针对LLM遗忘的事后最终更新设置,提供针对累积更新的全局修正,而非逐步的训练时控制。

给定基础模型W0和源遗忘模型Wun,我们从预训练模型到遗忘模型得到最终向量。我们并非统一编辑所有参数,而是将SAGE限制在一组结构化的可编辑模块G上,包括注意力和MLP投影矩阵,因为它们具有有意义的输入侧激活几何结构。对于每个模块g,我们将源更新定义为

Δg = { Wun,g - W0,g, g ∈ G; 0, g ∉ G }

相似文章

衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。