GROM:无梯度的快速一次性机器遗忘
摘要
介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。
查看缓存全文
缓存时间: 2026/08/07 07:52
# GROM:无梯度快速一步式机器遗忘
来源:https://arxiv.org/html/2608.05783
###### 摘要
机器遗忘已成为从大型语言模型(LLM)中安全移除特定敏感知识的关键能力。当前最先进的方法主要依赖基于微调的迭代式训练时遗忘。然而,即使使用像LoRA这样的参数高效降维技术,基于梯度的优化仍然计算昂贵,且缺乏显式的解析表达式。它还可能使目标知识仅仅被隐藏而非真正移除,以至于仅对遗忘后的模型进行量化,就能恢复大量本应被抹除的内容。为解决此问题,我们提出一种新颖的一步式遗忘方法,放弃迭代优化,转而采用直接精确的解析解。我们将遗忘过程建模为岭正则化最小二乘优化问题,为目标权重矩阵推导出闭式加法更新。该更新迫使所选层抑制不期望的内容,同时严格保持其在保留数据上的行为。GROM仅通过无梯度前向传播计算,无需反向传播,也无需迭代收敛,只需数秒即可完成权重编辑,因此比传统微调快数个数量级。大量评估表明,GROM在TOFU-5%、TOFU-10%、MUSE-Books、MUSE-News和WMDP上实现了最先进的遗忘-效用权衡,显著降低计算开销且不损失整体模型性能。由于该更新从权重中移除目标内容而非掩盖它,GROM还能抵御低比特量化攻击——这种攻击会恢复基于梯度的基线看似已遗忘的大量内容。我们的代码公开于https://github.com/Batorskq/GROM。
## 引言
大型语言模型(LLM)经常从庞大的训练语料中记忆敏感、私有或受版权保护的信息。因此,机器遗忘已成为选择性地擦除这些目标知识的关键机制。现有干预手段涵盖从推理时缓解到参数编辑和训练时更新的连续谱系(Liu et al., 2025;Ren et al., 2025)。缓解策略(如解码控制或基于提示的防御)充当轻量级盾牌,转移而非物理移除底层信息。相反,局部参数编辑方法(Ilharco et al., 2022;Meng et al., 2022)能对特定关联进行快速更新,但往往难以有效扩展到广泛的分布式遗忘集。目前,训练时遗忘通过优化模型参数以降低遗忘集的似然同时保留保留集效用,提供了最强性能。这涵盖广泛的目标函数,包括梯度上升(Thudi et al., 2022;Yao, Xu, and Liu, 2024a)、逆KL散度(Wang et al., 2024)和偏好式优化(Rafailov et al., 2023;Zhang et al., 2024b;Fan et al., 2025)。虽然有效,但这些方法本质上依赖迭代微调。即使利用LoRA等参数高效降维技术,基于梯度的优化仍然计算昂贵。更令人担忧的是,其产生的遗忘可能是表面的:最近的工作表明,仅对遗忘后的模型进行量化,即可恢复大量本应被移除的内容(Zhang et al., 2025),这表明微调往往将目标知识隐藏在低幅度的权重调整中,而低比特舍入会破坏这些调整。关键的是,这些方法还缺乏显式的解析表达式,迫使从业者依赖代价高昂的逐步梯度下降来逼近遗忘状态。
为从根本上解决这些低效问题,我们提出GROM(Gradient-free Rapid One-shot Machine-unlearning,无梯度快速一步式机器遗忘),一种新的遗忘公式,放弃迭代优化,转而采用直接精确的解析解。GROM并非跨多个epoch训练额外参数,而是在单步中计算目标权重矩阵的精确加法更新。我们将遗忘过程建模为岭正则化最小二乘优化问题,强制所选层抑制不期望的内容,同时严格保持其在保留数据上的输出。通过闭式求解该系统,GROM从遗忘数据和保留数据的无梯度前向传播(每编辑层一对)计算最优权重更新,在数秒内完成整个遗忘过程。
本工作的主要贡献有三点:
- **闭式遗忘公式**:我们在数学上将机器遗忘构建为具有闭式解析解的精确优化问题,完全绕开迭代微调的计算开销和优化不稳定性。
- **无梯度高效性**:GROM仅通过无梯度前向传播计算每层的最优加法更新,无需反向传播,也无需迭代收敛,因此比基于梯度的方法快最多两个数量级。
- **最先进权衡**:GROM在五个基准上取得Pareto最优的遗忘-效用权衡,并能抵御低比特量化攻击——该攻击会恢复强梯度基线看似已遗忘的大量内容,使GROM与黄金重训练模型一样保持遗忘性。相关代码已公开在https://github.com/Batorskq/GROM。
## 方法
在本节中,我们正式将机器遗忘任务定义为精确优化问题。首先建立问题设置以及岭正则化最小二乘目标,该目标具有唯一闭式解。然后详细设计基于token抑制和表示破坏的特定遗忘目标。最后描述我们的logit-lens层选择策略,并介绍一种精确的解析方法来审计单个删除请求的影响。
### 设置与可编辑矩阵
设 \(W\in\mathbb{R}^{m\times n}\) 为我们要编辑的权重矩阵,可以是语言模型头或MLP块的下投影。通过对遗忘数据执行一次无梯度前向传播、对保留数据执行一次,我们收集到 \(W\) 的*输入*,即逐token的“键”,并按列堆叠为:
\[
X_f\in\mathbb{R}^{n\times s}\ (\text{forget keys}),\qquad X_r\in\mathbb{R}^{n\times r}\ (\text{retain keys}).
\]
在每个其下一个token应被遗忘(或分别保留)的位置取一个键:遗忘/保留问答对中的答案token;当遗忘集为无标签语料时,则为该语料的每个token位置。该层在这些键上的当前输出为 \(WX_f\) 和 \(WX_r\)。重要的是,向 \(W\) 添加 \(\Delta\) 会将每个输出从 \(Wx\) 变为 \(Wx+\Delta x\)。仅当模型直接使用 \(Wx\)(要么将其加到残差流中,要么将其作为logits读取)时,我们才能控制这一偏移。这对于MLP下投影、注意力输出投影和LM头成立,但不适用于那些输出先经过非线性函数的投影(如up投影和gate投影)。在可用矩阵中,我们编辑MLP下投影,因为前馈块被广泛报道能存储事实并将其推向特定输出token(Geva et al., 2021, 2022;Dai et al., 2022)。相似文章
通过门控激活重定向的推理时机器遗忘
本文介绍了GUARD-IT,一种无需训练的机器遗忘方法,该方法在推理时使用输入相关的激活引导来从大型语言模型中移除目标知识,而无需修改权重,其性能匹配或超过基于梯度的基线方法,同时保持效用和对量化的鲁棒性。
信号引导的机器遗忘优化
提出GSUO,一种信号感知的机器遗忘优化框架,利用细粒度信号引导遗忘过程,避免过度遗忘和欠遗忘,性能优于14个基线方法。
基于边际自校正的大规模快速遗忘
介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。
MMFGU: Multimodal Federated Graph Unlearning
The paper proposes MMFGU, a multimodal federated graph unlearning framework that decouples target-specific representations to handle entity, modality, and pairing removal requests while preserving retained utility, achieving a 41.5x speedup over full retraining.
GRLO:从零开始迈向开放环境下的通用强化学习
GRLO 提出了一种新颖的强化学习后训练方法,仅使用 5000 条提示和 22.7 GPU 小时,就在多个领域(数学、代码等)实现了强大的泛化能力,在效率和数据需求上显著优于领域内的 RLVR 基线。