通过稀疏自编码器的测试时遗忘

arXiv cs.LG 论文

摘要

ARIA是一种用于大型语言模型的测试时遗忘方法,它使用稀疏自编码器在推理过程中抑制不需要的知识,而不修改权重,从而改善遗忘-保留权衡,并在对抗性攻击中保持稳健。

arXiv:2609.16229v1 公告类型:新 摘要:机器遗忘旨在从训练好的大型语言模型(LLM)中移除特定知识,而无需从头重新训练。现有方法通过梯度上升及其改进来修改模型权重。虽然在某些基准测试中有效,但这些基于权重的方法表现出尖锐的遗忘-效用权衡,其中对目标知识的更强遗忘会降低模型效用,而遗忘的知识可能在遗忘后微调或提示攻击下重新出现。我们提出ARIA(自编码器门控推理时遗忘),一种测试时遗忘方法,它保持模型权重不变,并在生成进入遗忘相关状态时仅抑制对不需要知识的访问。ARIA使用稀疏自编码器(SAE)潜在变量来训练一个轻量级线性检测器,然后对触发状态应用可解释的干预,且测试时开销可忽略不计。在TOFU、R-TOFU和WMDP上的实证评估表明,ARIA在思考模型(DeepSeek-R1-Distilled-Qwen-1.5B)和指令模型(Gemma-3-1B-it)上均改善了遗忘-保留权衡,优于基于权重的基线,例如显著降低WMDP-cyber遗忘集准确率,同时将MMLU保持在预遗忘模型的1%以内。我们进一步引入三种针对权重空间和解码空间恢复的遗忘后对抗性攻击,发现ARIA在所有三种攻击下均保持稳健,遗忘变化在攻击下小于1%。利用ARIA可解释性的特征级案例研究表明,一些保留退化可能反映了遗忘数据的响应风格,而非目标知识本身的泄露,突显了遗忘任务构建中的潜在偏见来源。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:45

# 通过稀疏自编码器实现测试时遗忘
来源:https://arxiv.org/html/2609.16229  
**Jinhao Duan**  
单位:北卡罗来纳大学教堂山分校  
**Vaishnav Tadiparthi**  
单位:本田研究所  
**Nakul Agarwal**  
单位:本田研究所  
**Kwonjoon Lee**  
单位:本田研究所  
**Ehsan Moradi Pari**  
单位:本田研究所  
**Hossein Nourkhiz Mahjoub**  
单位:本田研究所  
**Sijia Liu**  
单位:密歇根州立大学  
**Tianlong Chen**  
单位:北卡罗来纳大学教堂山分校

###### 摘要  
机器遗忘旨在从训练好的大型语言模型(LLM)中移除特定知识,而无需从头开始重新训练。现有方法通过梯度上升及其改进来修改模型权重。虽然在某些基准测试上有效,但这些基于权重的方法表现出显著的遗忘-效用权衡,即对目标知识的强烈遗忘会降低模型效用,并且被遗忘的知识可能在遗忘后微调或提示攻击下重新出现。我们提出了ARIA(基于自编码器门控的推理时遗忘),这是一种测试时遗忘方法,保持模型权重不变,仅在生成进入与遗忘相关的状态时,门控对不需要知识的访问。ARIA使用稀疏自编码器(SAE)隐变量来训练一个轻量级线性检测器,然后对被触发的状态应用可解释的干预,其测试时开销可忽略不计。在TOFU、R-TOFU和WMDP上的实证评估表明,ARIA在思维模型(DeepSeek-R1-Distilled-Qwen-1.5B)和指令模型(Gemma-3-1B-it)上均改善了与基于权重基线相比的遗忘-保留权衡,例如,在显著降低WMDP-cyber遗忘集准确性的同时,将MMLU保持在预遗忘模型的1%以内。我们进一步引入了三种针对权重空间和解码空间恢复的遗忘后对抗攻击,发现ARIA在所有三种攻击下均保持鲁棒,攻击下的遗忘变化小于1%。利用ARIA可解释性的特征级案例研究表明,一些保留性能下降可能反映了遗忘数据的潜在响应风格,而非目标知识本身的泄露,突显了遗忘任务构建中潜在的偏差来源。

## 1 引言  
图1:基于权重的遗忘方法表现出遗忘-效用权衡,其中更强的遗忘会降低保留性能。ARIA在效用损失可忽略不计的情况下实现了近乎完美的遗忘。  
机器遗忘旨在从训练好的大型语言模型(LLM)中选择性地切除目标知识,而无需重新训练的代价[6 (https://arxiv.org/html/2609.16229#bib.bib1),18 (https://arxiv.org/html/2609.16229#bib.bib2),3 (https://arxiv.org/html/2609.16229#bib.bib3)]。随着部署的LLM可能记忆私人、受版权保护或危险的内容[12 (https://arxiv.org/html/2609.16229#bib.bib4),24 (https://arxiv.org/html/2609.16229#bib.bib9)],这一需求变得日益迫切。在生成模型中,此类知识可能通过直接回答、转述、中间推理轨迹,或通过提示操作和微调攻击可恢复的行为泄露[29 (https://arxiv.org/html/2609.16229#bib.bib11),38 (https://arxiv.org/html/2609.16229#bib.bib12),48 (https://arxiv.org/html/2609.16229#bib.bib14)]。因此,有效的遗忘方法必须在保留模型在保留任务上的效用的同时,抑制目标知识。  
现有的LLM遗忘方法绝大多数通过修改模型权重来操作。基于梯度上升、偏好式目标和表征误导的技术已在标准基准测试上展示了降低的遗忘集性能[7 (https://arxiv.org/html/2609.16229#bib.bib5),47 (https://arxiv.org/html/2609.16229#bib.bib6),50 (https://arxiv.org/html/2609.16229#bib.bib7),13 (https://arxiv.org/html/2609.16229#bib.bib8),24 (https://arxiv.org/html/2609.16229#bib.bib9)],然而它们暴露了根本性的遗忘-保留矛盾。因为单一的全局参数更新必须同时抑制目标行为并保留相邻的保留行为,激进的遗忘往往会侵蚀通用效用,而保守的更新则会留下看似被遗忘内容的可恢复痕迹[34 (https://arxiv.org/html/2609.16229#bib.bib18),37 (https://arxiv.org/html/2609.16229#bib.bib20),53 (https://arxiv.org/html/2609.16229#bib.bib23)]。越来越多的证据进一步表明,基准测试的增益可能具有误导性的乐观,因为表面上被遗忘的知识已被证明会在提取提示、软提示、对抗性后缀、轻量级遗忘后微调和部署时量化下重新出现[41 (https://arxiv.org/html/2609.16229#bib.bib13),34 (https://arxiv.org/html/2609.16229#bib.bib18),37 (https://arxiv.org/html/2609.16229#bib.bib20),28 (https://arxiv.org/html/2609.16229#bib.bib19),53 (https://arxiv.org/html/2609.16229#bib.bib23),49 (https://arxiv.org/html/2609.16229#bib.bib21),51 (https://arxiv.org/html/2609.16229#bib.bib22)]。  
为了解决这些挑战,我们摒弃了寻求单一权重更新的现行范式,这种更新必须同时编码遗忘和效用。相反,我们将遗忘视为对冻结模型的运行时访问控制问题。如果在生成过程中能够识别与遗忘相关的状态,系统可以选择性地干预这些状态,同时让所有未触发的状态完全遵循原始模型。这一观点与一系列更广泛的关于测试时激活控制的研究相呼应,这些研究通过修改内部状态而非改变权重来引导模型行为[23 (https://arxiv.org/html/2609.16229#bib.bib42),42 (https://arxiv.org/html/2609.16229#bib.bib43),52 (https://arxiv.org/html/2609.16229#bib.bib46)]。测试时干预能否将遗忘与保留效用解耦,使LLM能够在完全不改变模型权重的情况下抑制不需要的知识?  
为了回答这个问题,我们提出了ARIA(基于自编码器门控的推理时遗忘),一种基于稀疏自编码器(SAE)特征的测试时遗忘方法。SAE将激活分解为稀疏隐变量特征,这些特征通常比单个神经元更具可解释性[9 (https://arxiv.org/html/2609.16229#bib.bib26),5 (https://arxiv.org/html/2609.16229#bib.bib27),40 (https://arxiv.org/html/2609.16229#bib.bib28),25 (https://arxiv.org/html/2609.16229#bib.bib31)]。ARIA保持基础LLM权重完全不变。它首先将生成的轨迹编码为来自在通用语料库上预训练的SAE的稀疏隐变量,然后仅训练一个轻量级稀疏线性头来识别与遗忘相关的生成状态。在推理时,这个头作为下一个令牌策略的门控。具体来说,当检测器被触发时,ARIA进行干预以抑制目标知识的暴露,否则生成在冻结模型分布下进行。由于检测器作为冻结SAE特征上的稀疏线性函数运行,每个触发可以归因于一小部分特定于层的隐变量,使得干预比全局权重编辑更具可检查性[4 (https://arxiv.org/html/2609.16229#bib.bib34),31 (https://arxiv.org/html/2609.16229#bib.bib32),14 (https://arxiv.org/html/2609.16229#bib.bib36),20 (https://arxiv.org/html/2609.16229#bib.bib37)]。  
我们在三个已建立的遗忘基准测试(即TOFU、R-TOFU和WMDP[29 (https://arxiv.org/html/2609.16229#bib.bib11),48 (https://arxiv.org/html/2609.16229#bib.bib14),24 (https://arxiv.org/html/2609.16229#bib.bib9)])上评估ARIA,涵盖思维模型(DeepSeek-R1-1.5B)和指令模型(Gemma-3-1B-it)。在所有设置中,ARIA比基于权重的基线产生了更强的遗忘-保留权衡。例如,在WMDP-cyber上,它将遗忘集准确性降低到远低于所有竞争方法,同时将MMLU保持在原始模型的1%降幅内。我们进一步引入了三种遗忘后对抗攻击,针对权重空间和解码空间,以探究看似被遗忘的行为是否可以恢复,并发现ARIA在所有三种攻击下均保持鲁棒。最后,利用ARIA可解释性的特征级案例研究揭示,微小的残余保留性能下降可能部分源于遗忘数据的潜在响应风格,而非目标知识本身,这引发了关于任务构建如何偏差遗忘评估的进一步问题。  
我们的贡献总结如下:
- • 我们引入了ARIA,一种轻量级、可解释且鲁棒的测试时遗忘方法,保持模型权重冻结。一个在通用语料库上预训练的稀疏自编码器提供可解释的隐变量特征,从这些特征中,一个轻量级线性头学习检测与遗忘相关的生成状态。仅对检测到的状态应用干预,从而在结构上将遗忘与保留解耦。
- • 我们证明了遗忘泄露和保留降级分别受相应检测器错误率的限制(定理3.1),并在三个基准测试(TOFU、R-TOFU、WMDP)和两个模型家族(DeepSeek-R1-1.5B, Gemma-3-1B-it)上进行了经验验证。ARIA一致地比所有基于权重的基线实现了更强的遗忘-保留权衡。我们进一步提出了三种覆盖权重空间和解码空间威胁的遗忘后对抗攻击,并表明ARIA在所有三种攻击下均保持鲁棒。
- • 利用ARIA稀疏检测器的可解释性,我们进行了特征级案例研究,将残余保留性能降级追溯到遗忘数据中的响应风格伪影,而非目标知识本身。这一发现表明,标准遗忘基准测试可能将风格模式与实质性知识混为一谈,为遗忘任务构建提出了潜在的研究问题。

## 2 相关工作  
#### 生成模型的机器遗忘。从训练好的LLM中移除特定知识主要被研究为一个基于权重修改的持续训练问题。早期的方法用令牌重新标记来调整微调[12 (https://arxiv.org/html/2609.16229#bib.bib4)],或用KL保留项形式化梯度上升和梯度差异[47 (https://arxiv.org/html/2609.16229#bib.bib6)]。后续工作通过偏好式目标缓解了简单上升的灾难性崩溃,包括NPO[50 (https://arxiv.org/html/2609.16229#bib.bib7)]和SimNPO[13 (https://arxiv.org/html/2609.16229#bib.bib8)]。表征误导(RMU)针对危险知识的移除[24 (https://arxiv.org/html/2609.16229#bib.bib9)],最近的一篇综述整合了设计空间[27 (https://arxiv.org/html/2609.16229#bib.bib10)]。标准评估集包括TOFU[29 (https://arxiv.org/html/2609.16229#bib.bib11)]、MUSE[38 (https://arxiv.org/html/2609.16229#bib.bib12)]和推理感知的R-TOFU[48 (https://arxiv.org/html/2609.16229#bib.bib14)],最后一个对思维链输出中的轨迹泄露进行评分。越来越多的证据表明,基于权重编辑的遗忘是浅层的。被遗忘的内容可通过提取提示[34 (https://arxiv.org/html/2609.16229#bib.bib18)]、嵌入空间软提示[37 (https://arxiv.org/html/2609.16229#bib.bib20)]、八路鲁棒性探针[28 (https://arxiv.org/html/2609.16229#bib.bib19)]以及最小化微调或单方向编辑[53 (https://arxiv.org/html/2609.16229#bib.bib23)]恢复。这个问题对于思维模型更为突出,其中R1轨迹表现出比最终答案更大的安全漏洞[30 (https://arxiv.org/html/2609.16229#bib.bib25)],而R2MU在保留推理能力的同时遗忘轨迹而非仅答案[43 (https://arxiv.org/html/2609.16229#bib.bib24)]。我们的工作与这一系列研究方向正交。我们不是编辑权重,而是将遗忘视为运行时访问控制,保持基础模型不变,仅在基于SAE的检测器标记遗忘触发器时进行干预。
#### LLM的测试时干预。另一系列平行工作在推理时控制LLM行为,同时保持模型权重固定。解码时间方法用辅助专家或安全感知令牌评分来引导生成[26 (https://arxiv.org/html/2609.16229#bib.bib41),46 (https://arxiv.org/html/2609.16229#bib.bib44)],而激活级方法通过真实性方向、激活加法、对比激活加法和表征工程来对内部表征进行干预[23 (https://arxiv.org/html/2609.16229#bib.bib42),42 (https://arxiv.org/html/2609.16229#bib.bib43),36 (https://arxiv.org/html/2609.16229#bib.bib45),52 (https://arxiv.org/html/2609.16229#bib.bib46)]。最近的工作使此类控制更具条件性和适应性,包括特定指令引导、条件拒绝、选择性多属性干预、基于回溯的引导、上下文依赖向量场和特定查询引导向量[39 (https://arxiv.org/html/2609.16229#bib.bib47),21 (https://arxiv.org/html/2609.16229#bib.bib48),33 (https://arxiv.org/html/2609.16229#bib.bib49),8 (https://arxiv.org/html/2609.16229#bib.bib50),22 (https://arxiv.org/html/2609.16229#bib.bib51),44 (https://arxiv.org/html/2609.16229#bib.bib52)]。ARIA共享这一文献的冻结模型前提,但将运行时控制应用于遗忘。其SAE隐变量检测器仅在生成进入与遗忘相关状态时路由干预,而不是应用全局引导方向或通用安全过滤器。
#### 用于可解释LLM的稀疏自编码器。稀疏自编码器将语言模型的中间激活分解为一个宽泛的、稀疏激活的字典,浮现出通常比单个神经元更具可解释性的隐变量特征[9 (https://arxiv.org/html/2609.16229#bib.bib26),5 (https://arxiv.org/html/2609.16229#bib.bib27)]。像TopK[16 (https://arxiv.org/html/2609.16229#bib.bib29)]和JumpReLU[35 (https://arxiv.org/html/2609.16229#bib.bib30)]这样的架构变体锐化了重建-稀疏性帕累托前沿,而像Gemma Scope[25 (https://arxiv.org/html/2609.16229#bib.bib31)]这样的开放套件使得逐层SAE广泛可用。除了特征发现,SAE隐变量越来越被用作因果操纵手柄。单个SAE特征已被用于引导Claude 3 Sonnet[40 (https://arxiv.org/html/2609.16229#bib.bib28)],稀疏特征电路实现了模型行为的因果编辑[31 (https://arxiv.org/html/2609.16229#bib.bib32)],聊天模型中的拒绝由单个残差流方向介导[1 (https://arxiv.org/html/2609.16229#bib.bib33)],提供了我们采用的隐变量干预的线性类比。SAE特征已被部署为有害提示的分类器[4 (https://arxiv.org/html/2609.16229#bib.bib34),15 (https://arxiv.org/html/2609.16229#bib.bib35)],以及LLM[14 (https://arxiv.org/html/2609.16229#bib.bib36),20 (https://arxiv.org/html/2609.16229#bib.bib37),32 (https://arxiv.org/html/2609.16229#bib.bib38),2 (https://arxiv.org/html/2609.16229#bib.bib39)]和扩散模型[10 (https://arxiv.org/html/2609.16229#bib.bib40)]中概念移除的消融目标。我们从SAE特征消融用于概念移除[14 (https://arxiv.org/html/2609.16229#bib.bib36),20 (https://arxiv.org/html/2609.16229#bib.bib37),32 (https://arxiv.org/html/2609.16229#bib.bib38)]中汲取见解,但将遗忘视为检测器门控的测试时响应控制。

## 3 方法论  
本节介绍ARIA的方法论,它将遗忘视为在冻结模型上的状态依赖路由,而非全局权重编辑,如图2 (https://arxiv.org/html/2609.16229#S3.F2)所示。第3.1节(http

相似文章