越流行越难遗忘:基于自适应流行度的大语言模型遗忘方法

arXiv cs.CL 论文

摘要

论文提出了AdaPop,一种基于自适应流行度的大语言模型遗忘方法,它根据事实频率调整梯度压力,以提高遗忘效果并减少查询下的信息泄露。

arXiv:2608.14229v1 Announce Type: new 摘要:流行事实在预训练中被记忆得更深刻,比罕见事实更难移除,但现有的大语言模型遗忘方法无论训练数据频率如何都应用统一的梯度压力。我们提出了AdaPop(自适应流行度)方法,它结合局部令牌置信度和来自外部代理(如Wikidata站点链接、LLM-as-Judge)的每个事实流行度相关的指数,并通过一个双上升控制器自动化遗忘-保留平衡,该控制器每个周期调整保留惩罚。在三个模型系列和两个基准测试中,AdaPop在改写查询下比竞争方法泄露少约5倍的被遗忘内容,在对抗性重新表述下少约1.6倍。我们通过内部指标支持我们的分析:在我们的方法下,遗忘集的隐藏状态比其他方法下更远离预遗忘模型的状态,而保留集的表示保持接近。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:55

# 越流行越难遗忘:大语言模型自适应遗忘方法
来源:https://arxiv.org/html/2608.14229

Anna Borisiuk  
致谢:a8or1suk@gmail\.com  
所属机构:AIRI、Sber AI Lab、Skoltech、ISP RAS可信人工智能研究中心

Andrey Savchenko  
所属机构:AIRI、Sber AI Lab、Skoltech、ISP RAS可信人工智能研究中心

Elena Tutubalina  
所属机构:AIRI、Sber AI Lab、Skoltech、ISP RAS可信人工智能研究中心

###### 摘要
在预训练期间,流行事实在模型中被记忆得更深,比罕见事实更难移除,然而现有的大语言模型遗忘方法无论训练数据频率如何,都施加统一的梯度压力。我们提出AdaPop(自适应流行度)方法,该方法结合局部词元置信度与基于外部代理(如维基数据站点链接、LLM-as-Judge)推导出的、与事实流行度相关的指数,并通过双上升控制器自动平衡遗忘-保留权衡,该控制器每个周期调整保留惩罚。在三个模型族和两个基准测试中,AdaPop在改写查询下泄露的遗忘内容比竞争方法少约5倍($\sim 5\times$),在对抗性重述下少约1.6倍($\sim 1.6\times$)。我们通过内部指标支持分析:在我们的方法下,遗忘集的隐藏状态比其他方法更远离遗忘前模型的状态,而保留集的表示则保持接近。

## 1 引言
机器遗忘(MU)[Cao and Yang 2015 (https://arxiv.org/html/2608.14229#bib.bib5); Bourtoule et al. 2021 (https://arxiv.org/html/2608.14229#bib.bib4)] 无需完全重新训练即可从已训练模型中移除目标知识,以解决大语言模型记忆预训练数据引发的隐私、安全和合规风险 [Carlini et al. 2021 (https://arxiv.org/html/2608.14229#bib.bib7); Tirumala et al. 2022 (https://arxiv.org/html/2608.14229#bib.bib36)]。遗忘集包含待移除的(查询,答案)对;保留集用于衡量保留的能力。现有的基于梯度和基于偏好的目标函数 [Jang et al. 2023 (https://arxiv.org/html/2608.14229#bib.bib17); Liu et al. 2022 (https://arxiv.org/html/2608.14229#bib.bib24); Zhang et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib45); Wang et al. 2025a (https://arxiv.org/html/2608.14229#bib.bib37)] 将每个遗忘示例视为同等难易删除。这一假设在经验上是错误的:在预训练期间出现更频繁的事实被编码得更深,更难移除 [Kandpal et al. 2023 (https://arxiv.org/html/2608.14229#bib.bib20); Merullo et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib30)]。因此,在整个遗忘集上应用统一的梯度幅度会导致系统性失败模式,即*流行度差距*:罕见事实被过度删除,损害保留质量,而流行事实被删除不足,在改写或对抗性提示下仍可恢复。最近的研究记录了这种跨方法和规模的差距 [Krishnan et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib21); Borisiuk et al. 2026 (https://arxiv.org/html/2608.14229#bib.bib3)],但未提出训练时的补救措施。Yu et al. 2026 (https://arxiv.org/html/2608.14229#bib.bib43) 确实在训练时进行了重新加权,但其应用于长尾图像分类,且基于模型自身的预测概率(第2.3节 [https://arxiv.org/html/2608.14229#S2.SS3])。那些从模型内在量(例如,Wang et al. 2025a [https://arxiv.org/html/2608.14229#bib.bib37] 中的每个词元置信度)校准遗忘信号的方法无法解决该差距,因为置信度反映的是当前输出行为,而非参数编码深度。请参考图注 Figure 1: AdaPop概述。流行度分数重新加权遗忘损失中每个事实词元的贡献;双上升控制器每个周期调整保留惩罚以维持保留质量(算法1 [https://arxiv.org/html/2608.14229#alg1])。

我们引入AdaPop(自适应流行度),这是第一个在训练时使每个事实的梯度更新依赖于*外部*流行度信号的遗忘方法(图1 [https://arxiv.org/html/2608.14229#S1.F1])。AdaPop将每个事实的流行度分数转化为幂律指数,以强化或软化每个词元上的上升信号,并将这种重新加权与一个自适应在线调整保留惩罚的双上升控制器相结合。我们在Llama [Grattafiori et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib14)]、Qwen [Qwen Team et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib31)]和Gemma [Team et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib35)]上对两个现实世界基准测试 [Borisiuk et al. 2026 (https://arxiv.org/html/2608.14229#bib.bib3); Jin et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib19)] 进行了评估,使用MMLU [Hendrycks et al. 2021 (https://arxiv.org/html/2608.14229#bib.bib15)] 和HellaSwag [Zellers et al. 2019 (https://arxiv.org/html/2608.14229#bib.bib44)] 跟踪通用能力的保留情况。我们的贡献包括:
- • **流行度感知梯度加权**。AdaPop将每个事实的外部流行度(例如,基于维基数据的代理分数、LLM-as-a-judge估计)映射为每个事实的幂律指数,以重新加权其词元级别的上升信号。这直接针对流行度差距,而非通过模型置信度。
- • **自动化遗忘-保留平衡**。一个周期级的双上升控制器将保留惩罚视为拉格朗日乘子,并根据观察到的保留损失漂移进行调整。这消除了每个数据集的超参数搜索,并防止在增加遗忘压力下保留能力崩溃。
- • **经验评估**。在未崩溃的方法中,AdaPop在所有三个模型上的对抗性查询得分最低,在两个模型上的改写得分最佳。词元排名和隐藏状态表明,答案是在模型内部被破坏,而不仅仅是在输出层被隐藏,同时通用能力保持在遗忘前检查点的0.05 MMLU范围内。

## 2 相关工作
### 2.1 机器遗忘方法
基于梯度的遗忘方法分为两大类。*上升基*方法在遗忘集上最大化负对数似然:梯度上升(GA;Jang et al. 2023 [https://arxiv.org/html/2608.14229#bib.bib17])无约束地这样做,常常破坏语言连贯性 [Yao et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib42); Zhang et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib45)];梯度差异(GD;Liu et al. 2022 [https://arxiv.org/html/2608.14229#bib.bib24])添加了保留损失,但对每个遗忘词元一视同仁 [Jin et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib18)];加权梯度上升(WGA;Wang et al. 2025a [https://arxiv.org/html/2608.14229#bib.bib37])根据模型对该词元的置信度对每个词元的损失进行加权,这使得每个词元对梯度的贡献相等。*基于偏好*的方法,如负偏好优化(NPO;Zhang et al. 2024 [https://arxiv.org/html/2608.14229#bib.bib45]),将输出分布推离记忆的响应。上升基方法遗忘激进但需要保留正则化;偏好基方法更温和,但在深度记忆事实上收敛更慢,这是一个我们重新进行经验研究的权衡(第5节 [https://arxiv.org/html/2608.14229#S5])。这四种方法均未利用模型外部的信号:遗忘压力完全来自模型当前的输出分布,这不能反映参数编码深度,而AdaPop直接解决了这一局限性(第3节 [https://arxiv.org/html/2608.14229#S3],表4 [https://arxiv.org/html/2608.14229#S5.T4])。Łucki et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib26) 指出,即使针对输出的推理时干预也保留了参数知识。

### 2.2 记忆、频率与遗忘
大语言模型的记忆与训练语料库的频率成比例 [Carlini et al. 2023 (https://arxiv.org/html/2608.14229#bib.bib6); Tirumala et al. 2022 (https://arxiv.org/html/2608.14229#bib.bib36)]:Kandpal et al. 2023 (https://arxiv.org/html/2608.14229#bib.bib20) 表明大语言模型回忆长尾事实不可靠,而Merullo et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib30) 证明频繁事实的编码更具线性,这为流行事实抵抗基于梯度的移除提供了机制基础。这种不对称性阻碍了遗忘:逐字记忆阻碍了视觉 [Zhao et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib46)] 和大语言模型环境中的移除 [Barbulescu and Triantafillou 2024 (https://arxiv.org/html/2608.14229#bib.bib2)],而Baluta et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib1) 表明不同暴露的数据点遗忘方式不同。对数概率不能反映记忆深度 [Wang et al. 2025a (https://arxiv.org/html/2608.14229#bib.bib37); Satvaty et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib33)]:模型可能在底层事实浅层编码时对表面模式赋予高置信度。外部代理(如站点链接计数)提供了独立于模型输出分布的、事实级别的信号。

### 2.3 流行度对遗忘的影响
Krishnan et al. 2025 (https://arxiv.org/html/2608.14229#bib.bib21) 通过控制预训练实验表明,高频事实要么未被遗忘,要么仅被表面遗忘,仍可通过对抗性查询提取。Borisiuk et al. 2026 (https://arxiv.org/html/2608.14229#bib.bib3) 在DUET中的现实世界事实上建立了相同的失败模式,表明基于维基百科的事实显著性可以预测现有方法的遗忘难度。这两项工作都描述了流行度差距,并提供了我们构建的基础基准,但均未提出缩小该差距的训练方法。我们通过引入新的自适应流行度方法(第3节 [https://arxiv.org/html/2608.14229#S3])来解决这一差距。

#### 局部与外部校准。 重新加权遗忘信号本身并非新思路;不同方法的关键在于权重的计算依据。WGA [Wang et al. 2025a (https://arxiv.org/html/2608.14229#bib.bib37)] 和 FaLW [Yu et al. 2026 (https://arxiv.org/html/2608.14229#bib.bib43)] 均从模型自身的预测概率推导,这是一种随训练进行而变化的*局部*信号。AdaPop从训练前固定且独立于模型输出的*外部*语料库频率代理推导其每个事实的指数。这一区别是经验性的而非术语性的:局部权重报告的是模型当前的输出,因此一旦表面答案被抑制,它就会饱和,这正是WGA的遗忘$\Delta$排名变为负值而改写回忆仍然存在的地方(第5.3节 [https://arxiv.org/html/2608.14229#S5.SS3])。FaLW还要求在未见过的同类数据上有一个参考分布;在事实级遗忘中,每个事实实际上都是其自己的类别,因此不存在这样的分布。

## 3 自适应流行度方法
我们将目标遗忘构建为一个约束优化问题:增加遗忘集损失,同时限制保留漂移。一个在所有事实上共享的单一保留系数$\alpha$(GD)或基于置信度的每个词元权重(WGA)无法同时服务于两种流行度模式:在单一梯度幅度下,流行事实抵抗删除,而罕见事实则遭受附带损害 [Satvaty et al. 2024 (https://arxiv.org/html/2608.14229#bib.bib33); Kandpal et al. 2023 (https://arxiv.org/html/2608.14229#bib.bib20)]。AdaPop则结合了(i)基于外部流行度代理计算的每个事实的幂律指数,以重新加权每个词元的上升信号,以及(ii)一个双上升保留控制器,每个周期更新保留惩罚。

### 3.1 问题形式化
令$\mathcal{D}$为模型$q_{\theta}$已被训练的预训练数据集。我们识别出两个不相交的子集$\mathcal{D}_{F}, \mathcal{D}_{R} \subset \mathcal{D}$($\mathcal{D}_{F} \cap \mathcal{D}_{R} = \emptyset$, $\mathcal{D}_{F} \cup \mathcal{D}_{R} \subsetneq \mathcal{D}$):*遗忘*集$\mathcal{D}_{F} = \left\{(x_{i}, y_{i}, s_{i})\right\}_{i=1}^{N_{F}}$,其中每个条目将一个问题-答案对$(x_{i}, y_{i})$与来自代理(如维基数据站点链接分数,第4节 [https://arxiv.org/html/2608.14229#S4])的流行度分数$s_{i}$耦合;*保留*集是$\mathcal{D}_{R} = \left\{(x_{j}, y_{j})\right\}_{j=1}^{N_{R}}$,是模型必须保留的知识的保留样本。我们考虑一个由条件概率$q_{\theta}(y_t \mid x, y_{<t})$定义的自回归模型$q_{\theta}$。

相似文章

衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。

基于边际自校正的大规模快速遗忘

arXiv cs.LG

介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。