丢失还是隐藏?监督持续学习中的概念级遗忘
摘要
本文介绍了一种基于稀疏自编码器(Sparse Autoencoders)的诊断框架,用于分析持续学习中的概念级遗忘,发现大部分遗忘源于表示不可访问性而非信息擦除。
arXiv:2605.16374v1 Announce Type: new
摘要:持续学习研究模型如何在适应新任务的同时保留先前获取的知识。尽管已有大量方法被提出以缓解灾难性遗忘,但该领域仍主要受性能驱动,对遗忘在视觉模型表示空间中的具体含义认识有限。先前工作主要通过任务级性能或表示漂移的粗粒度度量来分析遗忘,未能将输出级可访问性与更精细内部结构的变化分离开来。为此,我们提出了一种诊断框架,利用稀疏自编码器(SAEs)定义任务锚定的潜在特征空间,从而能够以更细粒度分析任务特定信息的演变——其中单个SAE潜在变量被视为模型内部计算中重复出现且相对解耦的视觉模式的概念代理。在该框架下,我们将遗忘分解为表观概念删除、可恢复性和可解码性。我们发现,在线性假设下,大量看似丢失的概念级信息通常可以恢复,而随着更多任务的引入,概念可解码性逐渐退化。总体而言,我们的结果表明,概念级遗忘的很大一部分可归因于表示可访问性的变化,而非信息的完全擦除。
查看缓存全文
缓存时间: 2026/05/19 06:42
# 丢失还是隐藏?监督持续学习中的概念级遗忘
来源:https://arxiv.org/html/2605.16374
Katarzyna Filus
波兰科学院理论与应用信息学研究所,波兰格利维采
kfilus@iitis\.pl
&Kamil Faber
AGH 科技大学,波兰克拉科夫
kfaber@agh\.edu\.pl
Roberto Corizzo
美利坚大学,美国华盛顿特区
rcorizzo@american\.edu
&Christopher Kanan
罗彻斯特大学,美国纽约州罗彻斯特
ckanan@cs\.rochester\.edu
###### 摘要
持续学习研究模型如何适应新任务,同时保留先前获取的知识。尽管已有广泛的方法被提出以缓解灾难性遗忘,但该领域仍以性能驱动为主,对遗忘在视觉模型表示空间中的具体对应关系了解有限。先前的工作主要通过任务级性能或粗粒度的表示漂移来评估遗忘,未能将输出级的可访问性与更精细内部结构的变化分离开来。为此,我们提出一个诊断框架,利用稀疏自编码器(SAE)定义一个任务锚定的潜在特征空间,从而以更细的粒度分析任务特定信息的演化方式——其中单个SAE潜在变量被视为概念代理,代表模型内部计算中反复出现且相对解耦的视觉模式。在此框架内,我们将遗忘分解为概念删除、可恢复性和可解码性。我们表明,在线性假设下,看似丢失的概念级信息中有很大一部分通常可以恢复,而概念的可解码性随着更多任务的引入而逐渐下降。总体而言,我们的发现表明,概念级遗忘的很大一部分可归因于表示可访问性的变化,而非信息的完全擦除。
## 1 引言
在顺序训练过程中先前学习知识的退化,即众所周知的灾难性遗忘,仍然是持续学习的核心挑战(Wang et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib20))。已提出多种遗忘缓解策略,包括基于回放的方法(Rolnick et al.,2019 (https://arxiv.org/html/2605.16374#bib.bib11))、正则化和蒸馏方法(Li and Hoiem,2017 (https://arxiv.org/html/2605.16374#bib.bib9))以及混合方法(Buzzega et al.,2020 (https://arxiv.org/html/2605.16374#bib.bib12))。尽管取得了进展,但评估仍以性能驱动为主,将遗忘等同于学习新任务后任务准确率的下降,而未解决遗忘如何在模型内部表现这一基本问题(Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5))。近期工作注意到了这一空白,并试图从输出级评估转向表示级评估(Hu et al.,2025 (https://arxiv.org/html/2605.16374#bib.bib10);Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5);Davari et al.,2022 (https://arxiv.org/html/2605.16374#bib.bib1);Gu et al.,2023 (https://arxiv.org/html/2605.16374#bib.bib15))。以往的研究大多使用相似性度量来衡量表示漂移(Kornblith et al.,2019 (https://arxiv.org/html/2605.16374#bib.bib3);Hu et al.,2025 (https://arxiv.org/html/2605.16374#bib.bib10);Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5))。其他工作(Davari et al.,2022 (https://arxiv.org/html/2605.16374#bib.bib1);Gu et al.,2023 (https://arxiv.org/html/2605.16374#bib.bib15))表明,许多表面上的性能损失可以通过重新训练分类器或施加表示约束来恢复。然而,这些分析仍然是全局性的,并且与任务级性能挂钩,因此无法捕捉细粒度信息是如何组织、变换或丢失的。
参见图注
图1:任务t数据在任务t+1训练后的概念转换分类。
类似于人类通过组合重复出现的概念来识别物体,近期在机械可解释性方面的进展使得能够以更解耦且可解释的特征来研究神经表示,这些特征用于执行学习到的任务(Bereska and Gavves,2024 (https://arxiv.org/html/2605.16374#bib.bib13))。这一点尤为重要,因为深度网络被认为依赖于叠加(superposition),其中多个概念——即模型计算中的重复模式——被编码在重叠的神经方向上,这使得特征级分析变得困难(Bereska and Gavves,2024 (https://arxiv.org/html/2605.16374#bib.bib13))。诸如稀疏自编码器(SAE)(Huben et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib23))和转译器(transcoder)(Dunefsky et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib24))等方法将表示映射到更高维度的稀疏潜在空间,从而可以分离出更原子化且可解释的特征。尽管这些潜在维度并不对应于真实语义概念,但它们通常能捕获模型计算中重复出现且相对解耦的模式,作为有用的*概念代理*,常常与诸如毛茸茸的动物或红色物体等抽象主题对齐(Bereska and Gavves,2024 (https://arxiv.org/html/2605.16374#bib.bib13))。在下文中,我们将其称为*概念*,并利用它们作为结构化的基础来分析持续学习过程中细粒度信息的演化。
在细粒度层面研究遗忘,其重要性应不亚于准确率退化,因为它能指示模型是否保留知识并支持稳定的解释,而非仅仅发生表示转移。然而,尽管机械可解释性具有潜力,但它在解决该问题上的应用仍然很少。唯一的相关工作(Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5))使用转译器将遗忘分析为共享潜在空间中特征的几何变换。然而,它关注的是特征*如何*变换,而非分析任务特定信息的可访问性。具体来说,它没有量化概念级的激活动态、单个特征的可解码性,或者在标准读出假设下看似丢失的信息能在多大程度上被恢复。因此,表示变化与功能遗忘之间的关系至今仍未得到充分理解。
在本工作中,我们通过提出一个概念级框架,从任务特定信息的可访问性角度分析遗忘,来填补这一空白。利用稀疏自编码器(SAE),我们定义了一个固定的、任务锚定的潜在空间,其中单个特征充当概念代理,从而能够细粒度地追踪信息在持续训练过程中的演化。在此框架内,我们将遗忘分解为概念删除、可恢复性和可解码性,区分了被移除的信息、未对齐的信息,以及虽仍存在但无法直接访问的信息。我们的结果表明,许多看似丢失的概念级信息仍然可以被线性恢复,这表明遗忘通常反映的是对底层计算模式的可访问性降低,而非真正的擦除。同时,一些概念随着时间的推移变得线性可解码性降低,这使得在标准线性读出下,可访问性的丧失在功能上等同于遗忘。此外,不同的持续学习策略在保留细粒度信息方面表现各异。我们的发现提供了一种统一的遗忘视图,将表示漂移、读出限制和概念级信息动态联系起来。我们的贡献可总结如下:
- • 我们引入了一个*概念级*框架用于分析持续学习中的遗忘,利用SAE定义了一个任务锚定的潜在空间,其特征充当概念代理。这使我们能够通过概念激活动态以及任务和概念级的可解码性,来研究任务特定知识的保留和线性可恢复性。
- • 我们定义了在持续学习后续任务后概念转换的分类:保留概念、看似删除的概念、恢复的概念、可解码的概念和丢失的概念(见图1 (https://arxiv.org/html/2605.16374#S1.F1))。
- • 我们表明,在单个概念层面上,任务特定信息有相当一部分仍然可以被线性恢复,并且不同的持续学习策略在保留细粒度知识及其可恢复性方面存在差异。
## 2 相关工作
持续学习中的大多数工作通过模型分类器性能的退化来量化遗忘(Verwimp et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib18);Soutif-Cormerais et al.,2023 (https://arxiv.org/html/2605.16374#bib.bib19);Kemker et al.,2018 (https://arxiv.org/html/2605.16374#bib.bib14);Kirkpatrick et al.,2017 (https://arxiv.org/html/2605.16374#bib.bib17))。大多数工作集中于开发缓解策略,包括基于回放的方法、正则化和蒸馏、架构方法以及混合变体(Wang et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib20);Parisi et al.,2019 (https://arxiv.org/html/2605.16374#bib.bib21);Faber et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib22)),遗忘通常通过基于准确率的指标来评估。尽管这一研究方向已经建立了有效的灾难性遗忘缓解方法,但它对遗忘如何在内部表示中表现所提供的见解有限。
更多近期的研究将遗忘与表示漂移和特征几何的变化联系起来(Davari et al.,2022 (https://arxiv.org/html/2605.16374#bib.bib1);Gu et al.,2023 (https://arxiv.org/html/2605.16374#bib.bib15);Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5);Hu et al.,2025 (https://arxiv.org/html/2605.16374#bib.bib10))。Davari et al. (2022) (https://arxiv.org/html/2605.16374#bib.bib1) 的作者表明,分类器级别的遗忘可能高估底层表示的退化。相比之下,我们超越了在原始特征上进行任务级探测的局限,通过使用SAE定义的、任务锚定的概念空间,来分析更细粒度的任务相关信息是否在概念层面上得以保留且可线性解码。
Gu et al. (2023) (https://arxiv.org/html/2605.16374#bib.bib15) 的作者通过向后的特征投影来强制任务间的线性可分性。相比之下,我们使用线性映射并非作为训练约束,而是作为一种诊断工具,用于衡量在标准持续学习策略下,过去的信息有多少仍然可以被线性恢复,以及这种可恢复性在何处失效。
在理解遗忘方面,机械可解释性提供了一种互补的视角,通过将神经表示分解为更原子化和可解释的组件,例如使用稀疏自编码器(SAE)和转译器(Huben et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib23);Dunefsky et al.,2024 (https://arxiv.org/html/2605.16374#bib.bib24);Bereska and Gavves,2024 (https://arxiv.org/html/2605.16374#bib.bib13))。这些方法构建了过完备的稀疏潜在空间,揭示出重复出现的解耦模式,为特征级分析提供了更强的基础。然而,机械可解释性在持续学习遗忘研究中仍很少被应用。
与我们的工作最接近的是 Masip et al. (2026) (https://arxiv.org/html/2605.16374#bib.bib5),其中使用转译器将不同任务的表示映射到一个共享空间,并将遗忘描述为旋转、缩放等几何变换。相比之下,我们的目标不是描述特征如何变换,而是研究和量化任务特定信息是否在概念层面上仍然可访问。为此,我们使用任务锚定的SAE潜在空间,并分析概念激活动态、线性可恢复性和概念级可解码性。这使我们能够区分被保留但未对齐的信息、隐式编码的信息,以及在线性读出下不再可访问的信息。
## 3 遗忘作为可访问性的丧失:一个概念级框架
在本节中,我们将遗忘的概念级分析表述为对细粒度任务特定信息的可访问性丧失,而非信息的完全丢失。核心问题是:那些经过持续训练后不再支持原始任务读出的信息,是被擦除了,还是仍然存在于表示中,但处于未对齐、激活较弱或更难解码的状态?我们的框架是诊断性的,分析过去任务信息在模型内部的演化方式。
#### 问题设置。
令 \(\mathcal{D}^t = \{(x_i^t, y_i^t)\}_{i=1}^{N_t}\) 表示任务 \(t\) 的数据集。令 \(f_{\theta_t}\) 表示在任务 \(t\) 上训练后的持续模型特征提取器,而 \(f_{\theta_{t+s}}\) 表示在进一步训练任务 \(t+1, \dots, t+s\) 后的同一提取器。我们研究在这两个模型下任务 \(t\) 数据的表示:
\[
h_t(x) = f_{\theta_t}(x), \quad h_{t+s}(x) = f_{\theta_{t+s}}(x), \quad x \in \mathcal{D}^t.
\]
(1)
目标是分析任务 \(t\) 的表示在后续训练后如何演化,以及任务相关信息在多大程度上仍然可访问。
#### 表示的线性平移。
持续训练可能引入表示空间中的几何偏移,但未必移除信息。为了研究这种行为,我们引入一个线性平移映射:
\[
T_{t+s \to t}(h) = W_{t+s} h + b_{t+s},
\]
(2)
该映射通过任务 \(t\) 的训练数据进行训练,以使 \(h_{t+s}(x)\) 与 \(h_t(x)\) 对齐:
\[
\min_{W,b} \mathbb{E}_{x \sim \mathcal{D}^t_{\text{train}}} \left\| W h_{t+s}(x) + b - h_t(x) \right\|_2^2.
\]
(3)
学习到的映射 \(T_{t+s \to t}\) 随后应用于 \(t\) 的测试数据。我们使用线性映射来匹配持续学习中的标准读出,从而可以在典型决策头下进行恢复分析。这一选择得到了先前工作的支持,这些工作表明遗忘可以通过重新训练线性头来缓解(Davari et al.,2022 (https://arxiv.org/html/2605.16374#bib.bib1)),任务表示可能保持线性相关(Gu et al.,2023 (https://arxiv.org/html/2605.16374#bib.bib15)),并且与线性表示假设一致(Elhage et al.,2022 (https://arxiv.org/html/2605.16374#bib.bib6);Bereska and Gavves,2024 (https://arxiv.org/html/2605.16374#bib.bib13);Masip et al.,2026 (https://arxiv.org/html/2605.16374#bib.bib5))。如果任务 \(t\) 的信息可以通过线性映射恢复,那么遗忘可能反映的是表示变化,而非完全擦除。
#### 通过稀疏自编码器的概念代理。
为了以比任务准确率或全局表示相似性更细的粒度分析遗忘,对于每个任务 \(t\),我们在 \(h_t(x)\) 的训练集上训练一个 SAE,并使用训练好的 SAE 编码器获取不同的测试表示:
\[
z_t(x) = \text{SAE}_t(h_t(x)), \quad z_{t+s}(x) = \text{SAE}_t(h_{t+s}(x)), \quad z_T(x) = \text{SAE}_t(T_{t+s \to t}(h_{t+s}(x))),
\]
(4)
其中 \(z(x) \in \mathbb{R}^K\) 表示潜在激活值。SAE 训练于相似文章
已删除,但未消失:输出遗忘并非真正遗忘
本文认为,标准的输出层机器遗忘评估高估了成功程度,表明方法可以在输出层看似成功,同时保留与重新训练模型相关的结构性表征层差异。作者提出与重新训练一致的表征遗忘作为更强的评估视角。
不忘记的艺术:一种用于持续学习的局部学习架构
本文介绍了CMP(认知记忆原语),一种持续学习架构,它使用稀疏关系编码和局部学习来减少灾难性遗忘,在字节级语言建模协议上展示了比使用EWC的Transformer更好的反向迁移。
稀疏自编码器中概念学习与神经元解释的几何视角
本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。
遗忘并非擦除:通过传输键恢复潜在知识
本文认为神经网络中的灾难性遗忘并非擦除,而是一个接口对齐问题。它提出了'传输键'来从顺序训练的模型中恢复潜在的任务特定特征,展示了在分割CIFAR-100上的显著性能恢复。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。