通过门控激活重定向的推理时机器遗忘

arXiv cs.LG 论文

摘要

本文介绍了GUARD-IT,一种无需训练的机器遗忘方法,该方法在推理时使用输入相关的激活引导来从大型语言模型中移除目标知识,而无需修改权重,其性能匹配或超过基于梯度的基线方法,同时保持效用和对量化的鲁棒性。

arXiv:2605.12765v1 Announce Type: new 摘要:大型语言模型会记忆大量训练数据,引发了隐私、版权侵权和安全方面的担忧。机器遗忘旨在移除特定遗忘集的影响,同时保持模型性能,理想情况下近似于从头开始重新训练但不包含遗忘集的模型。现有方法通过基于梯度的方式更新模型参数来实现这一目标。然而,这些更新计算成本高,会导致不可逆的权重变化,并且在模型被量化部署时性能下降。最近一种替代修改模型权重的方法是激活工程,即在推理过程中改变激活值以引导模型行为。尽管避免了权重编辑,但简单的激活引导有其自身的失败模式,因为单一的全局引导向量对每个输入施加相同的干预,导致模型行为发生意外变化。我们提出了通过门控激活重定向的推理时遗忘(GUARD-IT),这是一种无需训练和梯度的方法,通过在推理时进行输入相关的激活引导来实现遗忘。所得到的干预以残差流中保持范数的旋转形式应用,不修改模型权重。在TOFU和MUSE上的实验表明,GUARD-IT在三种模型规模上匹配或超过了12种基于梯度的基线方法,同时是唯一在所有设置下同时保持效用、抑制记忆并避免灾难性崩溃的方法。GUARD-IT进一步支持无需重新训练的持续遗忘,并且在量化情况下仍然有效,而参数编辑方法在此情况下性能会下降。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:18

## 通过门控激活重定向实现在线推理中的机器遗忘 来源: https://arxiv.org/html/2605.12765 \\correspondingauthor Vinícius Conte Turani \(v\.turani@edu\.pucrs\.br\),Rodrigo C\. Barros \(rodrigo\.barros@pucrs\.br\) 和 Lucas S\. Kupssinskü \(lucas\.kupssinsku@pucrs\.br\) Vinícius Conte Turani同等贡献MALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Otávio Parraga同等贡献MALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西João Vitor Boer AbitanteKristen K\. ArguelloMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Joana PasqualiMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Ramiro N\. BarrosMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Flavio du Pin Calmon哈佛大学Christian MattjieMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Rodrigo C\. BarrosMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西Kunumi Institute,巴西Lucas S\. KupssinsküMALTA,机器学习理论与应用实验室,PUCRS,阿雷格里港,巴西 ###### 摘要 大型语言模型会记忆大量训练数据,引发隐私、版权侵权和安全方面的担忧。机器遗忘旨在移除目标遗忘集Df\\mathcal\{D\}\_\{f\}的影响,同时保持模型性能,理想情况下近似于从头开始训练且不使用Df\\mathcal\{D\}\_\{f\}的模型。现有方法通常通过基于梯度的方法更新模型参数来实现这一目标。然而,这些更新计算成本高昂,会导致不可逆的权重变化,并且在模型量化部署时性能下降。最近,激活工程作为改变模型权重的一种替代方案出现,它通过在推理过程中改变激活值来引导模型行为。尽管绕过了权重编辑,但朴素的激活引导会引入自身的失败模式,因为单个全局引导向量对所有输入应用相同的干预,导致模型行为发生意外变化。我们提出了通过门控激活重定向的推理时遗忘(GUARD-IT),这是一种无需训练和梯度的推理时卸载方法,通过依赖于输入的激活向量引导来实现遗忘。我们的方法将遗忘集Df\\mathcal\{D\}\_\{f\}划分为语义聚类,在离线阶段为每个聚类计算一个引导向量,并在推理时通过一个相似度网关将每个用户查询路由到相关的聚类向量。该干预以残差流中的保范旋转形式应用,不改变模型权重。在TOFU和MUSE上的实验表明,GUARD-IT在三种模型规模上匹配或超过了12个基于梯度的基线方法,同时在所有设置中,它是唯一能够同时保持效用、抑制记忆并避免灾难性崩溃的方法。GUARD-IT还支持无需重新训练的持续遗忘,并且在量化场景(参数编辑方法在此场景下性能下降)中仍然有效。 ## 1 引言 大型语言模型(LLMs)可能记忆训练数据,引发对隐私、版权侵权、意外偏见和安全性的担忧liu2025rethinking,parraga2025fairness,shi2024muse。机器遗忘(MU)旨在通过移除目标遗忘集Df\\mathcal\{D\}\_\{f\}的影响来解决这一问题,同时保持对保留集Dr\\mathcal\{D\}\_\{r\}的性能liu2025rethinking。理想情况下,这近似于完全从Dr\\mathcal\{D\}\_\{r\}开始训练的模型,消除了Df\\mathcal\{D\}\_\{f\}的显式记忆和分布统计影响。这一目标颇具挑战性,因为知识以分布式模式编码在参数中,使得选择性移除困难,且不易影响无关行为elhage2022toymodelssuperposition。大多数现有的MU方法依赖计算成本高昂的参数更新,例如在Df\\mathcal\{D\}\_\{f\}上的梯度上升dorna2025openunlearning。这些方法需要访问完整的微调流程,并且经常导致灾难性崩溃,即模型失去泛化能力并产生不连贯的输出zhang2024npo。此外,其遗忘效果可能因后续模型更新、压缩或量化技术而受损或失效abitante2026quantization。这些限制在实际部署中至关重要,因为模型通常为了效率而被量化,导致离散的参数空间改变优化动态,可能使基于梯度的遗忘变得不稳定或无效。此外,许多现实场景需要持续遗忘,即随时间接收多个遗忘请求。在这种设置下,重复的参数更新会累积干扰,加剧无关知识的遗忘,导致模型逐步退化。 激活工程(或表示工程)是一种无需训练的方法,通过在推理时注入线性概念方向来引导模型行为,而无需修改任何权重turner2024steeringlanguagemodelsactivation,zou2023representation。如果将其应用于遗忘,这表明可以通过直接识别和操作遗忘方向来实现方向性抑制。大多数方法在整个目标语料库上计算单个引导向量(SV),当目标行为可以通过单个紧凑数据集捕捉时,这是合理的。然而,当语料库涵盖冲突方向时,该向量会对它们进行平均,从而失去特异性yu2020gradient,liu2024conflict。不加区分地应用固定SV会进一步降低对无关输入的输出质量tan2024analysing,而标准的加法引导通过扰动隐藏状态的范数,使下游层的层归一化和注意力缩放不稳定vu2025angularsteeringbehaviorcontrol,you2026sphericalsteeringgeometryawareactivation。 为了解决这些问题,我们引入了通过门控激活重定向的推理时遗忘(GUARD-IT)1,这是一种基于梯度的无需训练和梯度的MU方法,适用于LLMs。GUARD-IT完全在激活空间操作,将遗忘作为受控的几何变换执行。GUARD-IT将遗忘语料库划分为语义聚类,在离线阶段预计算引导向量。在推理时,相似度网关(SG)将用户查询动态路由到依赖于输入的遗忘表示。关键的是,GUARD-IT将此干预作为残差流中的纯旋转应用,保留原始激活范数,确保模型稳定性。总之,本文的贡献如下: 1. 我们将遗忘表述为一个无需训练和梯度的引导问题,在激活空间中应用保范旋转,实现稳定、模型无关的行为控制。 2. 我们引入了一个带有聚类原型引导向量(PSV)的相似度网关,实现了依赖于输入的遗忘,适应每个查询的语义内容。 3. 我们展示了这种推理时架构自然地支持持续遗忘,并且在量化场景下仍然有效,而基于梯度的方法则会退化。 ## 2 GUARD-IT GUARD-IT受线性表示假设启发zou2023representation,该假设认为高层概念被编码为模型激活空间中的方向。遵循激活工程框架turner2024steeringlanguagemodelsactivation以及先前关于推理时干预的工作li2023inference,我们计算编码待遗忘内容方向的SV,并在推理时进一步利用它们。与以往使用单个全局SV的工作panickssery2024steeringllama2contrastive不同,GUARD-IT将遗忘语料库聚类为语义组,并为每个聚类计算一个PSV。每个PSV捕获其聚类的遗忘方向。SG独立控制每个输入每PSV的贡献,允许多个PSV同时激活并共同组成最终的SV。这种设计实现了局部化和组合式的遗忘,避免了类似干预设置中常见的失败模式。 GUARD-IT分两个阶段运行,以保持推理时的开销最小。*离线阶段*每个遗忘语料库执行一次,产生一组预计算的引导材料。*在线阶段*在推理时运行,包括一个轻量级路由决策,随后进行单次激活空间变换。在任何阶段都不修改模型权重。算法1和算法2提供了GUARD-IT两个阶段的简要程序总结。附录A说明了GUARD-IT的完整流水线。 算法1 GUARD-IT:离线阶段 1: 输入:遗忘语料库 Df\\mathcal\{D\}\_\{f\},保留语料库 Dr\\mathcal\{D\}\_\{r\},目标层 l\\ell,最大聚类数 KmaxK\_\{\\max\} 2: 输出:\{ck,h ̄kf,ρ ̄kf\}k=1K\\\{\\mathbf\{c\}\_\{k\},\\;\\bar\{\\mathbf\{h\}\}^\{f\}\_\{k\},\\;\\bar\{\\rho\}^\{f\}\_\{k\}\\\}\_\{k=1\}^\{K\}, h ̄r\\bar\{\\mathbf\{h\}\}^\{r\}, ρ ̄r\\bar\{\\rho\}^\{r\} 3: 4: 使用ST φ\(·\)\\phi\(\\cdot\)嵌入并L2归一化所有 d∈Dfd\\in\\mathcal\{D\}\_\{f\} 5: 通过轮廓分数选择 k⋆k^\{\\star\}(式2);运行K-Means →\\t到聚类 \{Ck\}\\\{C\_\{k\}\\\},质心 \{ck\}\\\{\\mathbf\{c\}\_\{k\}\\\} 6:对于 k=1,...,k⋆k=1,\\ldots,k^\{\\star\} 执行 7:提取CkC\_\{k\}在层 l\\ell的隐藏状态;计算 h ̄kf\\bar\{\\mathbf\{h\}\}^\{f\}\_\{k\}和ρ ̄kf\\bar\{\\rho\}^\{f\}\_\{k\}(式3) 8:结束循环 9:提取Dr\\mathcal\{D\}\_\{r\}在层 l\\ell的隐藏状态;计算 h ̄r\\bar\{\\mathbf\{h\}\}^\{r\}和ρ ̄r\\bar\{\\rho\}^\{r\}(式3) 算法2 GUARD-IT:在线阶段 1: 输入:用户输入 x,阈值 TT,激活值 hl\\mathbf\{h\}^\{\\ell\},系数 α\\alpha,上述离线输出 2: 输出:引导后的激活值 hl\\mathbf\{h\}^\{\\ell\} 3: 4: 使用句子-Transformer(ST)φ\(x\)\\phi\(\\mathbf\{x\}\)嵌入 x\\mathbf\{x\} 5: 计算活跃聚类 K\(x\)\\mathcal\{K\}\(\\mathbf\{x\}\)(式4) 6: 如果 \|K\(x\)\|≠0\|\\mathcal\{K\}\(\\mathbf\{x\}\)\|\\neq 0 则 7: 聚合活跃PSV: p\(x\)=1\|K\(x\)\|∑k∈K\(x\)h ̄kf\\mathbf\{p\}\(\\mathbf\{x\}\)=\\frac\{1\}\{\|\\mathcal\{K\}\(\\mathbf\{x\)\|\}\\sum\_\{k\\in\\mathcal\{K\}\(\\mathbf\{x\}\)\}\\bar\{\\mathbf\{h\}\}^\{f\}\_\{k\} 8: 通过正交计算SV v\(x\)\\mathbf\{v\}\(\\mathbf\{x\}\)(式6) 9: 缩放到激活范数 →v^\(x\)\\to\\hat\{\\mathbf\{v\}\}\(\\mathbf\{x\}\)(式7) 10: 在层 l\\ell应用旋转(式8) 11: 返回引导后的激活值 h′⁣l\\mathbf\{h\}^\{\\prime\\ell\} 12: 结束如果 13: 返回 hl\\mathbf\{h\}^\{\\ell\} ### 2.1 离线阶段 #### 2.1.1 语义聚类 遗忘集Df=\{d1,...,dN\}\\mathcal\{D\}\_\{f\}=\\\{\\textbf\{d\}\_\{1\},\\ldots,\\textbf\{d\}\_\{N\}\\\}中的每个文档使用句子-Transformer(ST)φ\\phi嵌入并进行L2归一化。我们执行kk-均值聚类将Df\\mathcal\{D\}\_\{f\}划分为kk个聚类。我们还评估了其他聚类算法,在下游遗忘质量上没有观察到一致差异,因此我们默认选择kk-均值,因为它在所有关键变量(聚类数、对象数和特征数)上具有线性成本。选择kk-均值的另一个动机是单位范数向量的几何性质,因为在L2归一化嵌入上最小化欧氏距离等价于最大化聚类内余弦相似度。每个聚类质心表示该聚类的语义方向。聚类数kk通过在候选范围\{2,3,...,kmax\}\\\{2,3,\\ldots,k\_\{\\text\{max\}\}\\\}上最大化平均轮廓分数来自动选择。设ei=φ\(di\)\\textbf\{e\}\_\{i\}=\\phi\(\\textbf\{d\}\_\{i\}\)为嵌入后的文档di\\textbf\{d\}\_\{i\},对于划分为kk个聚类且di∈Cr\\textbf\{d\}\_\{i\}\\in C\_\{r\},我们有: ak\(i\)=1\|Cr\|−1∑φ\(dj\)∈Crj≠id\(φ\(di\),φ\(dj\)\),bk\(i\)=minCt≠Cr⁡1\|Ct\|∑φ\(dj\)∈Ctd\(φ\(di\),φ\(dj\)\),a\_\{k\}\(i\)=\\frac\{1\}\{\|C\_\{r\}\|\-1\}\\sum\_\{\\begin\{subarray\}\{c\}\\phi\(\\mathbf\{d\}\_\{j\}\)\\in C\_\{r\}\\\\ j\\neq i\\end\{subarray\}\}d\(\\phi\(\\mathbf\{d\}\_\{i\}\),\\phi\(\\mathbf\{d\}\_\{j\}\)\),\\qquad b\_\{k\}\(i\)=\\min\_\{C\_\{t\}\\neq C\_\{r\}\}\\frac\{1\}\{\|C\_\{t\}\|\}\\sum\_\{\\phi\(\\mathbf\{d\}\_\{j\}\)\\in C\_\{t\}\}d\\left\(\\phi\(\\mathbf\{d\}\_\{i\}\),\\phi\(\\mathbf\{d\}\_\{j\}\)\\right\),\(1\) 分别表示平均聚类内距离和到最近邻聚类的平均距离。然后通过以下公式选择最优聚类数: k⋆=argmaxk∈\{2,...,kmax\}⁡\[1N∑i=1Nbk\(i\)−ak\(i\)max⁡\{ak\(i\),bk\(i\)\}\]。k^\{\\star\}=\\operatorname\*\{arg\\,max\}\_\{k\\in\\\{2,\\ldots,k\_\{\\max\}\\\}\}\\left\[\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\frac\{b\_\{k\}\(i\)\-a\_\{k\}\(i\)\}\{\\max\\\{a\_\{k\}\(i\),\\,b\_\{k\}\(i\)\\\}\}\\right\]。\(2\) 虽然太小的kk会将不同主题合并到一个聚类中,但太大的kk会将连贯的文档分割成冗余的PSV。更高的轮廓分数表明遗忘语料库分解为定义良好、不重叠的主题,从而实现更精准的每聚类引导。 #### 2.1.2 激活提取 GUARD-IT为遗忘和保留语料库中的每个文档提取目标层 l\\ell的隐藏状态表示,沿着遗忘语料库的*相反*方向进行引导,以抑制其在隐藏层中的表达。对于语料库D\\mathcal\{D\}中的每个文档,我们捕获层 l\\ell的残差流,并平均池化所有token表示以获得该实例的PSV;我们在附录B中对比了使用最后一个token提取的结果,并消融了此选择。我们专注于提取残差流中间层的激活值,这些激活值在表示丰富性和可重定向性之间最大化权衡panickssery2024steeringllama2contrastive,arditi2024refusal。早期层主要编码词汇和句法特征,对扰动高度敏感,会将小的干预传播成不受控制的下游效应skean2025layer;晚期层接近输出分布,留给引导信号塑造生成的深度有限。根据经验,GUARD-IT最有效的层位于模型*更早*的位置,大约在变压器堆栈的第一个四分位,而不是先前行为引导工作panickssery2024steeringllama2contrastive,arditi2024refusal和表示级遗忘工作li2024wmdp所偏好的中间层。行为引导任务(如拒绝或情感)对应于在堆栈中间结晶的抽象概念,而遗忘目标则是编码在前向传递早期更粗糙表示中的实体级关联。较早干预也可能为模型留下更多残差深度以连贯地整合扰动,从而减少激进后期引导导致的胡言乱语副作用。我们在附录C中提供了完整的按层消融研究。 我们通过平均层 l\\ll处的激活来构建语料库D\\mathcal\{D\}上的PSV: h ̄D=1N∑i=1Nhdi\(l\),\\bar\{\\mathbf\{h\}\}^\{\\mathcal\{D\}\}=

相似文章

GROM:无梯度的快速一次性机器遗忘

arXiv cs.LG

介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

arXiv cs.LG

本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。