相似性感知的机器遗忘
摘要
本文提出了一种面向机器遗忘的保留感知定位方法,可减少对语义相似保留样本的附带损害,并引入了一个保留相似性评估集。在CIFAR-10上的ResNet18实验表明,该方法减少了附带损害并改善了遗忘指标。
arXiv:2608.00246v1 公告类型:新论文
摘要:机器遗忘从已训练模型中移除用户指定训练样例的影响,从而避免从头重新训练。基于定位的方法通过识别有影响力的模型参数子集来提高遗忘效率。然而,现有方法仅基于遗忘集重要性选择参数,忽视了它们在保留数据集中的作用,常常对语义相似的保留样例造成附带损害。针对这一局限,我们提出了一种保留感知的定位方法,同时考虑参数对遗忘数据和保留数据的重要性。我们还引入了一个保留相似性评估集,利用模型嵌入空间中的余弦相似度构建,以直接衡量附带损害。在CIFAR-10数据集和ResNet18模型上的十一种实验设置中,我们的方法在改善标准遗忘指标的同时持续减少附带损害,证明了保留感知定位在相似性感知机器遗忘中的有效性。
查看缓存全文
缓存时间: 2026/08/04 07:38
# 相似性感知的机器遗忘
来源:https://arxiv.org/html/2608.00246
11institutetext:英国曼彻斯特大学计算机科学系 22institutetext:英国谢菲尔德大学机器智能中心 33institutetext:英国谢菲尔德谢菲尔德大学计算机科学学院 44institutetext:法国巴黎第九大学 - PSL大学,法国巴黎
44email:madhavan\.citalamangalamkumaran@student\.manchester\.ac\.uk, m\.parakkalunni@sheffield\.ac\.uk, vasiliki\.kouni@lamsade\.dauphine\.fr, haripriya\.harikumar@manchester\.ac\.uk
###### 摘要
机器遗忘旨在消除用户指定的训练样本对已训练模型的影响,而无需从头重新训练。基于定位的方法通过识别一组有影响力的模型参数来提高遗忘效率。然而,现有方法仅依据遗忘集的重要性来选择参数,忽略了这些参数在保留数据集中的作用,常常对语义相似的保留样本造成附带损害。我们通过一种保留感知的定位方法来解决这一局限,该方法同时考虑参数对遗忘数据和保留数据的重要性。我们还引入了一个保留相似评估集,通过在模型嵌入空间中使用余弦相似度构建,直接衡量附带损害。在 CIFAR-10 数据集和 ResNet18 模型上的十一种实验设置中,我们的方法持续减少了附带损害,同时改进了标准遗忘指标,证明了保留感知定位在相似性感知机器遗忘中的有效性。
## 1 引言
机器学习模型会在不同程度上记忆单个训练样本的信息\[26 (https://arxiv.org/html/2608.00246#bib.bib5)\],即使底层训练记录无法直接访问,也会造成隐私风险。成员推断攻击可以揭示某个样本是否被用于训练\[23 (https://arxiv.org/html/2608.00246#bib.bib8)\],模型反演攻击\[11 (https://arxiv.org/html/2608.00246#bib.bib61)\]可以暴露敏感属性\[21 (https://arxiv.org/html/2608.00246#bib.bib99)\],而生成模型可以逐字复制其训练语料库中的段落\[6 (https://arxiv.org/html/2608.00246#bib.bib58)\]。当模型在个人或敏感数据上训练时,这些风险会被放大\[20 (https://arxiv.org/html/2608.00246#bib.bib100),21 (https://arxiv.org/html/2608.00246#bib.bib99)\]。诸如通用数据保护条例\[25 (https://arxiv.org/html/2608.00246#bib.bib52)\]和加州消费者隐私法案\[19 (https://arxiv.org/html/2608.00246#bib.bib63)\]等数据保护框架确立了与个人数据擦除或删除相关的权利。这些隐私风险和数据删除权利共同推动了消除模型中残余影响机制的需求。
机器遗忘\[5 (https://arxiv.org/html/2608.00246#bib.bib46),2 (https://arxiv.org/html/2608.00246#bib.bib2),27 (https://arxiv.org/html/2608.00246#bib.bib1)\]通过修改已训练模型来解决这一问题,使其行为近似于一个在未包含用户指定训练子集(称为遗忘集)的情况下重新训练得到的神谕模型。在剩余数据上从头重新训练提供了最佳解决方案,但计算成本可能很高,尤其是在删除请求频繁的情况下。因此,近似遗忘\[17 (https://arxiv.org/html/2608.00246#bib.bib9)\]方法试图以显著更低的计算成本近似重训练模型的行为。局部化遗忘\[24 (https://arxiv.org/html/2608.00246#bib.bib7)\]方法通过将模型修改限制在对遗忘集有影响力的选定参数子集上,进一步降低了这一成本。
然而,对遗忘集的重要性并不意味着对遗忘集的专一性。一个参数可能对遗忘样本具有高度影响力,同时也支持保留样本。当遗忘样本和保留样本在学习到的表示空间中占据邻近区域,并可能依赖于共享特征时,这种重叠尤其重要,如图1 (https://arxiv.org/html/2608.00246#S1.F1)所示(红色和绿色框中的视觉相似图像自然会在其嵌入空间中聚类在一起)。
Refer to caption图1:中间特征空间可视化显示,语义相似的样本在类特定簇中彼此靠近嵌入。要遗忘的图像(红色)和要保留的图像(绿色)在特征流形上占据非常接近的相邻区域,表明存在共享的特征表示。因此,仅基于遗忘集的定位可能会修改两组样本都使用的参数,从而对表示相似的保留样本造成意外退化。我们将这种表示上的重叠称为特征纠缠,并将由此产生的退化称为附带损害。由于这种损害可能集中在少数保留样本上,因此总体测试准确率和保留集准确率可能无法揭示这一问题。
为了解决这一局限,我们提出了一种保留感知的定位框架。我们分别在遗忘集和保留集上计算关键性分数,并将它们结合起来,优先选择对遗忘集重要但对保留集相对不太重要的神经元。为了直接衡量附带损害,我们还构建了一个保留相似评估集。对于每个遗忘样本,该集合包含其原始模型嵌入空间中余弦相似度最高的同类别保留邻居。我们的贡献如下。
- • 我们指出了对语义相似的保留样本造成的附带损害是现有基于定位的机器遗忘方法的一个关键局限,并将这一现象与共享学习表示联系起来。
- • 我们提出了一种保留感知的定位框架,该框架同时纳入参数对遗忘数据和保留数据的重要性,从而实现相似性感知的遗忘。
- • 我们引入了一种保留相似评估协议,并证明在十一种实验设置下,我们的方法持续减少附带损害,同时改进标准遗忘指标。
## 2 背景
在介绍我们的方法之前,我们先说明全文使用的符号和定义。设D:=⋃n≥1\(X×Y\)n\\mathcal\{D\}:=\\bigcup\_\{n\\geq 1\}\(\\mathcal\{X\}\\times\\mathcal\{Y\}\)^\{n\}表示所有数据集的集合,A\\mathcal\{A\}表示随机训练算法,A:D→Δ\(H\)\\mathcal\{A\}:\\mathcal\{D\}\\rightarrow\\Delta\(\\mathcal\{H\}\),其中Δ\(H\)\\Delta\(\\mathcal\{H\}\)表示假设空间H\\mathcal\{H\}上所有概率分布的集合。假设空间H:=\{fθ:X→Y∣θ∈Rd\}\\mathcal\{H\}:=\\\{f\_\{\\theta\}:\\mathcal\{X\}\\to\\mathcal\{Y\}\\mid\\theta\\in\\mathbb\{R\}^\{d\}\\\}是学习算法A\\mathcal\{A\}产生的所有模型的集合,由权重向量θ∈Rd\\theta\\in\\mathbb\{R\}^\{d\}参数化。我们用fθo∼A\(Dtrain⊂D\)f\_\{\\theta^\{o\}\}\\sim\\mathcal\{A\}\(D\_\{train\}\\subset\\mathcal\{D\}\)表示在训练集Dtrain⊂DD\_\{train\}\\subset\\mathcal\{D\}上训练、在遗忘之前由θo\\theta^\{o\}参数化的原始模型。
设遗忘集记为Df⊂DtrainD\_\{f\}\\subset D\_\{train\},由请求移除的数据组成。保留集定义为Dr=Dtrain∖DfD\_\{r\}=D\_\{train\}\\setminus D\_\{f\},表示剩余的训练数据。我们将fθr∼A\(Dr\)f\_\{\\theta^\{r\}\}\\sim\\mathcal\{A\}\(D\_\{r\}\)表示为神谕模型,θr\\theta^\{r\}为仅在保留集上从头训练得到的相关参数。机器遗忘被定义为修改模型参数的过程,即从A\(Dtrain\)\\mathcal\{A\}\(D\_\{train\}\)开始修改模型的参数,以消除DfD\_\{f\}的影响,同时不损害保留集DrD\_\{r\}上的性能。形式上,
###### 定义1(遗忘\[3 (https://arxiv.org/html/2608.00246#bib.bib13)\])
如果一个遗忘算法U\\mathcal\{U\}使得遗忘后的模型fθu∼U\(fθo,Df,Dr\)f\_\{\\theta^\{u\}\}\\sim\\mathcal\{U\}\(f\_\{\\theta^\{o\}\},D\_\{f\},D\_\{r\}\)与重训练模型fθr∼A\(Dr\)f\_\{\\theta^\{r\}\}\\sim\\mathcal\{A\}\(D\_\{r\}\)难以区分,则称该算法遗忘了遗忘集Df⊂DtrainD\_\{f\}\\subset D\_\{\\text\{train\}\},其中Dr=Dtrain∖DfD\_\{r\}=D\_\{\\text\{train\}\}\\setminus D\_\{f\}。形式上,fθuf\_\{\\theta^\{u\}\}和fθrf\_\{\\theta^\{r\}\}在评估分布上的输出分布相同。
定义1刻画了机器遗忘的目标,即遗忘后的模型fθuf\_\{\\theta^\{u\}\}应表现得与仅在保留集DrD\_\{r\}上从头训练的模型难以区分。满足该定义的一种方式是精确遗忘,即仅使用DrD\_\{r\}从头重新训练模型,得到fθr∼A\(Dr\)f\_\{\\theta^\{r\}\}\\sim\\mathcal\{A\}\(D\_\{r\}\)。虽然精确遗忘直接满足了定义,但在大型模型和数据集上进行重训练计算成本很高。因此,实际方法通常采用近似遗忘,即遗忘算法U\\mathcal\{U\}修改原始模型fθof\_\{\\theta^\{o\}\}以获得fθu∼U\(fθo,Df,Dr\)f\_\{\\theta^\{u\}\}\\sim\\mathcal\{U\}\(f\_\{\\theta^\{o\}\},D\_\{f\},D\_\{r\}\)。目标是使遗忘后的模型fθuf\_\{\\theta^\{u\}\}的输出与重训练模型fθrf\_\{\\theta^\{r\}\}的输出紧密匹配,同时所需的计算量显著减少。更精确地说,机器遗忘方法旨在实现以下目标:
t\(U\(fθo,Df,Dr\)\)\\displaystyle t\\bigl\(\\mathcal\{U\}\(f\_\{\\theta^\{o\}\},\\,D\_\{f\},D\_\{r\}\)\\bigr\)≪t\(A\(Dr\)\),\\displaystyle\\ll t\\bigl\(\\mathcal\{A\}\(D\_\{r\}\)\\bigr\),(1)U\(fθo,Df,Dr\)\\displaystyle\\mathcal\{U\}\(f\_\{\\theta^\{o\}\},\\,D\_\{f\},D\_\{r\}\)≈A\(Dr\),\\displaystyle\\approx\\mathcal\{A\}\(D\_\{r\}\),(2)其中t\(⋅\)t\(\\cdot\)表示遗忘或训练过程的执行时间。我们使用以下定义来与Torkzadehmahani等人\[24 (https://arxiv.org/html/2608.00246#bib.bib7)\]保持一致,对遗忘评估进行操作化。
###### 定义2(局部化机器遗忘\[24 (https://arxiv.org/html/2608.00246#bib.bib7)\])
设θo=\{θk\}k=1N\\theta^\{o\}=\\\{\\theta\_\{k\}\\\}\_\{k=1\}^\{N\}表示原始模型的参数,其中NN是可训练参数的总数。如果一个遗忘算法U\\mathcal\{U\}在给定遗忘集DfD\_\{f\}的情况下,识别并仅修改参数的一个子集θs⊂θo,\|θs\|=n<N,\\theta\_\{s\}\\subset\\theta^\{o\},\|\\theta\_\{s\}\|=n<N,而在遗忘过程中保持其余参数不变,则称该算法执行局部化机器遗忘。得到的遗忘模型来自U\(fθo,Df,Dr\),\\mathcal\{U\}\(f\_\{\\theta^\{o\}\},D\_\{f\},D\_\{r\}\),其中更新仅限于选定的参数子集θs\\theta\_\{s\}。
###### 定义3(记忆分数\[26 (https://arxiv.org/html/2608.00246#bib.bib5)\])
对于训练集DtrainD\_\{train\}中的数据点xix\_\{i\}及其标签yiy\_\{i\},\(xi,yi\)∈Dtrain\(x\_\{i\},y\_\{i\}\)\\in D\_\{train\},使用随机训练算法A\\mathcal\{A\}的记忆分数定义如下:
mem\(A,D,xi\)=Prfθ∼A\(Dtrain\)\(fθ\(xi\)=yi\)−Prfθ′∼A\(Dtrain∖\(xi,yi\)\)\(fθ′\(xi\)=yi\),\\text\{mem\}\(\\mathcal\{A\},D,x\_\{i\}\)=\\Pr\_\{f\_\{\\theta\}\\sim\\mathcal\{A\}\(D\_\{train\}\)\}\(f\_\{\\theta\}\(x\_\{i\}\)=y\_\{i\}\)\-\\Pr\_\{f\_\{\\theta^\{\\prime\}\}\\sim\\mathcal\{A\}\(D\_\{train\}\\setminus\(x\_\{i\},y\_\{i\}\)\)\}\(f\_\{\\theta^\{\\prime\}\}\(x\_\{i\}\)=y\_\{i\}\),其中fθf\_\{\\theta\}是由θ\\theta参数化的模型,从分布A\(Dtrain\)\\mathcal\{A\}\(D\_\{train\}\)中采样;fθ′f\_\{\\theta^\{\\prime\}\}是由θ′\\theta^\{\\prime\}参数化的模型,从分布A\(Dtrain\)∖\(xi,yi\)\\mathcal\{A\}\(D\_\{train\}\)\\setminus\(x\_\{i\},y\_\{i\}\)中采样。第一项考虑在完整数据集上训练的模型参数,第二项考虑在未包含样本\(xi,yi\)\(x\_\{i\},y\_\{i\}\)的情况下训练的模型参数。高记忆分数表明排除该样本会导致模型对该样本的性能发生显著变化。
## 3 提出的相似性感知局部化遗忘
我们提出了一个相似性感知局部化遗忘框架,该框架扩展了按示例删除定位(DEL)\[24 (https://arxiv.org/html/2608.00246#bib.bib7)\]方法,明确将遗忘集和保留集图像在中间特征空间中的相似性纳入遗忘过程。现有的基于定位的遗忘方法\[24 (https://arxiv.org/html/2608.00246#bib.bib7)\]主要从遗忘集\(Df\)\(D\_\{f\}\)中识别有影响力的层和神经元,而没有考虑这些参数是否也对保留集\(Dr\)\(D\_\{r\}\)中语义相似的样本有贡献。因此,修改定位到的参数可能会影响保留集中已学习到的表示。
我们的关键观察是,语义相似的遗忘样本和保留样本被嵌入在中间特征空间的邻近区域(如图1 (https://arxiv.org/html/2608.00246#S1.F1)所示),因此倾向于激活重叠的神经元子集。受这一观察的启发,我们利用来自遗忘集和保留集的信息进行定位。为了解决这一局限,我们的方法使用遗忘样本,并通过保留集约束遗忘过程以保留其表示。通过联合考虑参数定位和样本相似性,我们选择性地修改遗忘特定知识,同时最小化对DrD\_\{r\}的附带损害。通过联合分析跨DfD\_\{f\}和DrD\_\{r\}的神经元重要性,我们提出的方法能够识别与遗忘集强关联的参数,同时考虑它们对相似保留样本的贡献。这种相似性感知的定位能够有针对性地移除遗忘特定知识,同时减少对保留知识的附带损害,并保持模型的整体性能。
###### 定义4(语义相似性)
设φ\(⋅\)\\phi\(\\cdot\)表示模型产生的嵌入表示。对于两个样本xix\_\{i\}和xjx\_\{j\},它们学习到的表示之间的语义相似性使用余弦相似度定义为
sim\(xi,xj\)=φ\(xi\)⊤φ\(xj\)‖φ\(xi\)‖‖φ\(xj\)‖\.\\mathrm\{sim\}\(x\_\{i\},x\_\{j\}\)=\\frac\{\\phi\(x\_\{i\}\)^\{\\top\}\\phi\(x\_\{j\}\)\}\{\\\|\\phi\(x\_\{i\}\)\\\|\\,\\\|\\phi\(x\_\{j\}\)\\\|\}\.(3)
当两个样本在学习的特征空间中的嵌入表示具有高余弦相似度时,它们被认为是语义相似的。考虑一个遗忘集样本\(xi,yi\)∈Df\(x\_\{i\},y\_\{i\}\)\\in D\_\{f\}和一个保留集样本\(xj,yj\)∈Dr\(x\_\{j\},y\_\{j\}\)\\in D\_\{r\},使得sim\(xi,xj\)\\mathrm\{sim\}\(x\_\{i\},x\_\{j\}\)很高。由于这两个样本在学习到的表示空间中占据邻近区域,它们很可能共享中间特征表示,并依赖于重叠的模型参数子集。
###### 定义5(相似性感知局部化遗忘)
考虑θo=\{θk\}k=1N\\theta^\{o\}=\\\{\\theta\_\{k\}\\\}\_\{k=1\}^\{N\}表示原始模型fθof\_\{\\theta^\{o\}\}的参数,mem\(θk,xi\)\\text\{mem\}\(\\theta\_\{k\},x\_\{i\}\)量化参数θk\\theta\_\{k\}对样本xix\_\{i\}记忆的贡献。如果一个遗忘算法U\\mathcal\{U\}选择参数子集θs⊂θo,\|θs\|=n<N,\\theta\_\{s\}\\subset\\theta^\{o\},\|\\theta\_\{s\}\|=n<相似文章
自模式连通性引导的基于流形表示遗忘的近似机器遗忘
本文提出 ManiF-SMC,一种完全在表征空间中运行的近似机器遗忘方法,通过将擦除样本从其原始学习的流形表征推向保留数据中其最近的语义邻居,并使用由自模式连通性模块引导的基于边界的三元组损失来实现自适应边界。
窄域遗忘,广域保留:作为非对称泛化问题的机器遗忘
本文将大型语言模型中的机器遗忘界定为一个非对称泛化问题,提出了SUITE评估协议与训练语料库以解决遗忘不足与过度遗忘问题,并介绍了JensUn++算法,该算法在三个大型语言模型上实现了最佳的遗忘-保留效用权衡。
基于边际自校正的大规模快速遗忘
介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。
PreUnlearn:在大语言模型遗忘前审计附带知识损害
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。
在遗忘中应忘记什么?语言模型的遗忘集策划
本文探讨了语言模型中机器遗忘的遗忘集策划,引入了一个评估逐字输出抑制的基准,并强调了效果与能力保留之间的权衡。