持续学习中的干扰与保持

arXiv cs.LG 论文

摘要

本文提出将持续学习中的遗忘建模为任务间的干扰,并引入了干扰门控功能分配(IGFA),这是一种无需回放、无需Fisher信息的方法,根据任务几何结构共享或保护方向,当任务可分离时实现无损保留。

arXiv:2607.09202v1 公告类型:新 摘要:持续学习通常依赖于事后机制,如回放、弹性正则化或蒸馏。本文认为遗忘应直接建模为任务间的干扰。在冻结特征机制下,学习新任务导致的遗忘正是对旧任务产生的干扰能量。在深度网络中,通过路径平均曲率以最少的额外前向传播即可恢复相同的量。 当任务支撑集不相交时,遗忘可以被结构性消除;当任务支撑集在冲突方向上重叠时,非零失真下限不可避免。同样的几何结构通过任务感知正交化实现模型的最优合并。基于这一分析,我们推导出干扰门控功能分配(IGFA),这是一种无需回放、无需Fisher信息的方法,在任务对齐时共享方向,在任务冲突时保护方向。在多个基准测试中,IGFA在任务结构性可分离时实现无损保留,在不可分离时将不可避免的代价从不可逆的遗忘转移到可延迟但可恢复的可塑性上。它在不同任务流上匹配了最强的无回放结构性基线,并在相似性使得迁移值得保留时优于无条件投影方法。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 持续学习中的干扰与保留
来源:https://arxiv.org/html/2607.09202
Julius Störk¹,∗  
¹VARTA Microbattery GmbH, 埃尔旺根, 德国  
∗通讯作者:[email protected]  
2026年7月10日  

###### 摘要
持续学习通常依赖于回放、弹性正则化或蒸馏等事后机制。本文认为,遗忘应被直接建模为任务间的干扰。在冻结特征体制中,学习新任务导致的遗忘恰好是旧任务上产生的干扰能量。在深度网络中,通过路径平均曲率并以极小的额外前向传播即可恢复相同的量。当任务支撑集不相交时,遗忘可以在结构上被消除;当任务支撑集在冲突方向上重叠时,非零的失真下限是无法避免的。相同的几何结构通过任务感知正交化实现了模型的最优合并。基于这一分析,我们提出了干扰门控功能分配 (Interference-Gated Functional Allocation, igfa),这是一种无需回放、无需Fisher信息的方法:当任务方向对齐时共享方向,当它们冲突时保护方向。在多个基准测试中,当任务在结构上可分离时,igfa实现了无损保留;当任务不可分离时,它将不可避免的成本从不可逆的遗忘转移到延迟但可恢复的可塑性中。在不相似任务流上,igfa与最强的无回放结构基线相匹配;当相似性使迁移值得保留时,igfa在无条件投影方法上有所改进。

**关键词:** 持续学习;灾难性遗忘;模型合并;神经正切核;梯度投影;率失真;表示几何

请参阅标题
图1:准确率与遗忘对比。九种方法在 exact-A1 旋转数字基准(五个旋转角度,冻结随机特征;55个种子的均值)上进行测试,并按方法类别区分:基线 (∙)、校正性 (∙)、结构性 (∙) 和合并 (∙);我们的方法标记为“(ours)”,并以相应类别颜色的星形 (★, ★) 表示;准确率越高(向上)越好,遗忘越低(向右)越好。校正性方法 (EWC, 回放) 和结构性方法 (ogd/gpm, igfa) 顺序学习数据流,而合并方法独立解决每个旋转问题并离线组合。
*(i)* 定理4 (https://arxiv.org/html/2607.09202#Thmtheorem4) 的 Σ-正交合并达到了接近或acles的准确率(0.885,对比每个任务0.903的上限),且具有最小的合并后残差下限 (D=0.032,对比各向同性和欧几里得合并的 0.20 和 0.38),证实了任务诱导的非欧几里得 Σ-度量是用于合并的正确内积。
*(ii)* 在在线、无缓冲区和无Fisher信息的方法中,我们的有符号门控 (igfa) 达到了最高准确率;对保护边界进行退火处理(退火 igfa)以稍低的准确率换取了更低甚至为负的遗忘。包含置信区间和残差 D 消融实验的完整数据见附录 S4 (https://arxiv.org/html/2607.09202#A4)。

## 1 引言
一个在任务 B 之后顺序学习任务 A 的模型,通常在任务 A 上性能下降,这一现象被称为灾难性遗忘。通过随机梯度下降 (SGD) 或其变体训练的网络仅根据当前小批量(或一小段窗口内小批量的平滑平均)更新参数;因此更新是**对过去知识无意识的**。当训练数据独立同分布时,这种无意识性是理想的,但在持续学习场景中,一旦训练分布随时间变化,它就会带来危害。标准方法如回放 [3, 4, 5]、弹性权重巩固 [1, 2] 和蒸馏 [6] 大多是在干扰发生后修复遗忘。目前仍缺乏一种预测性解释,说明何时干扰是可避免的,何时是不可避免的,以及更新必须满足何种结构才能在不牺牲有用迁移的情况下保留旧行为。

本文聚焦于线性-特征体制,其中冻结的特征提取器 φ(x) 与可训练的线性头部配对,涵盖了常见的冻结骨干和参数高效微调 (PEFT) 设置,以及全训练网络的一阶神经正切 [11] 近似。由于学习任务 B 引起的更新 Δ 导致早期任务 A 的遗忘,恰好等于干扰能量 ½ Δ^⊤ Σ_A Δ,其中 Σ_A = E_{x∼D_A} [φ(x) φ(x)^⊤] 表示任务 A 的特征二阶矩,衡量了对该任务激活的特征方向。相同的几何结构能准确预测每个任务的遗忘,并可近似推广到具有特征漂移的更深层网络。

本文贡献有三点。

1. **干扰泛函及其可移除性**。我们推导出一个精确的遗忘干扰泛函。在冻结特征体制中,遗忘恰好是新更新在旧任务上产生的干扰能量,这给出了一个清晰的标准,用于判断何时保留是无损的,何时失真下限是不可避免的。Σ_A 的几何结构仅惩罚其活跃子空间内的分量,而 ker Σ_A 中的更新则不会改变任务 A 的损失。这给出了无损保留的结构性判据:当任务支撑集不相交时(在各向同性几何中退化为普通正交性),干扰是可移除的;而重叠的支撑集则意味着非零的失真下限。相同的量还通过任务推理问题具有信息论解释。

2. **最优合并作为 Σ-正交化**。我们证明最优合并是任务感知正交化。这将离线模型合并和在线持续学习统一为求解相同干扰目标的批处理和增量解决方案。第 3.4 节(https://arxiv.org/html/2607.09202#S3.SS4)表明合并后损失可分解为任务拟合度和任务间干扰。最小化此目标需要任务向量的相互 Σ-正交性,从而得出模型合并的最优条件。

3. **干扰门控功能分配**。我们介绍了 igfa,一种无需回放的结构性控制器。该方法在任务对齐时共享容量,在冲突时保护容量,仅保留一个低秩子空间摘要。第 4 节(https://arxiv.org/html/2607.09202#S4)介绍了 igfa,一种受相同泛函启发的在线方法(图 2,https://arxiv.org/html/2607.09202#S1.F2)。

请参阅标题
图2:特征空间中的任务诱导几何结构促使选择完全共享、完全分离或选择性参数共享。
*左(不相交)*。当两个任务激活正交的特征子空间时,更新 Δ 由 Δ_∥ ∈ range Σ_A(位于等损失等高线之间,导致遗忘)和 Δ_⊥ ∈ ker Σ_A(沿等损失等高线,分配无干扰)组成。
*中(重叠)*。当支撑集共享一个活跃方向时,任务 B 的任何更新都无法避免 range Σ_A,失真下限不可避免。
*右*。相同的泛函产生三种更新规则。朴素下降完全引入干扰(扭曲旧知识);正交投影 (ogd/gpm [7, 8]) 移除所有重叠(无遗忘,但无迁移且容量耗尽);igfa 应用一个**有符号**门控——共享对齐方向,正交化冲突方向——在保留和迁移之间取得平衡,同时仅保留被占子空间作为状态。

第 5 节(https://arxiv.org/html/2607.09202#S5)中的实验旨在直接检验理论,包括在不相关支撑集上的无损分配、将不可避免的成本从遗忘转移到延迟可塑性、在 s^* ≈ 0.26 处的相似性阈值,以及一旦累积占用秩达到特征维度 T·r ≈ d(其中 T 是流中任务数,r 是每个任务占用的特征子空间秩,d 是特征维度)时容量下限的出现。在冻结特征的分割数字 (Split-Digits) 设置中,igfa 以约 0.98 的准确率和近乎为零的遗忘匹配了最强的无回放和无Fisher信息基线,同时不使用回放缓冲区。扩展到全网络训练、大规模叠加以及与回放的大规模直接比较见第 6 节,支持实验详见支持信息。

## 2 相关工作

#### **校正性持续学习**。回放 [3, 4, 5]、正则化 [1, 2] 和蒸馏 [6] 仍然是持续学习的主要校正方法。然而,它们没有通过任务几何结构显式建模干扰,而本文推导的干扰泛函预测了任务更新的冲突,并识别出何时可以在冲突发生前将其移除。回放可以看作同一任务二阶矩 Σ_t 的随机蒙特卡洛估计量,而我们通过低秩子空间以无样本方式估计该矩。

#### **几何与梯度方法**。一系列相关工作直接控制更新方向。正交梯度下降 (OGD) [7]、梯度投影记忆 (GPM) [8] 和正交权重修改 (OWM) [9] 将更新投影远离与先前任务相关的子空间。在固定特征映射下,这相当于强制 Δ ∈ ker Σ_A。PCGrad 类方法 [10] 通过成对梯度比较而非显式任务子空间保护来解决冲突。最近的工作还研究了密切相关的体制:测地线对齐梯度投影 [27] 处理顺序学习中的特征漂移,MINGLE [28] 使用零空间准则在测试时合并门控低秩专家。与这些方法相比,本框架从精确的遗忘泛函推导出投影条件,用相似性门控的共享或正交化规则取代无条件投影,并使用相同的泛函来同时刻画合并和失真下限。基于神经正切核 (NTK) 的分析 [12, 13] 也将遗忘与表示空间中的重叠联系起来,但未发展出 Σ-正交性准则或相关的迁移门控。

#### **平均雅可比矩阵作为具有可解释性的共享对象**。一种收敛的几何概念出现在机械可解释性中。Gurnee、Lindsey 等人的雅可比透镜 [33] 通过其**上下文平均**的前向雅可比矩阵 J_ℓ = E[∂h_final / ∂h_ℓ] 与解嵌入的组合来表征残差流激活,并识别其活跃读出方向的低秩跨度(“J-空间”)作为**可言语化**表示的子空间,该子空间容量有限且竞争性占用,相当于一个语言模型全局工作空间。我们的干扰几何是同一操作的动力学对应:J-透镜平均前向激活→输出雅可比矩阵,而我们平均高斯-牛顿曲率 Σ_A = E[J_w J_w^⊤](第 3.3 节),两者都基于相同的理由用分布平均的雅可比矩阵取代单点雅可比矩阵——为了从上下文特定使用中分离出架构级不变量。两者在对表示空间的划分上相同:它们因果负载的 J-空间扮演了我们 range Σ_A 的角色(那里的扰动改变输出并导致遗忘),而坐标修补“保持不变”的 inert 补集是我们的 ker Σ_A(自由方向)。这样理解,我们的干扰能量和失真下限为工作空间**竞争**提供了定量模型,占用秩容量拐点为其**有限容量**提供了率失真解释;反之,释放的透镜是我们方法跟踪的大规模平均雅可比子空间的一个现成估计量。我们在第 6 节使这一联系可测试。

#### **模型合并与任务算术**。在平行文献中,独立微调的模型被合并成一个单一模型,通过权重空间任务向量的算术运算 [14, 15] 保留每个任务的有用知识。这些方法通常在欧几里得参数空间中操作,而本分析识别出由 Σ_t 诱导的任务相关度量是相关的几何。在此度量下,最优合并变为相互 Σ-正交化,仅当 Σ_t ∝ I 时才恢复普通的权重空间正交性。任务奇异向量 (TSV) [24] 通过白化任务向量的奇异方向来促进正交性;相比之下,各向同性合并 [25] 表明共享子空间的各向同性可以优于严格正交化。WUDI-Merging [23] 在精神上尤为接近,因为它将任务向量与输入子空间联系起来并在没有数据的情况下最小化干扰;我们工作的关键区别在于度量和残差是从精确的遗忘泛函**推导**出来的,而非通过近似子空间论证。切空间持续合并 [26] 也在一个一阶体制中操作,但在可扩展性和功能特异性之间做出类似的权衡。本文采用的共同观点是,相同的干扰泛函同时支配离线合并和在线持续分配。

#### **场景、规模与可塑性**。标准的任务增量、领域增量和类增量分类法 [16] 区分了任务标识是给定还是需要推断。在此背景下,后面发展的失真下限为支撑集重叠与任务推理提供了定量联系。相关的经验性和分析性工作研究了规模和预训练的影响 [17],以及冻结骨干提示适配器方法 [18, 19, 20],这些方法学习带有输入查询的提示池。

相似文章

几何冲突:解释并控制大模型持续后训练中的遗忘

Hugging Face Daily Papers

本研究探讨了任务几何如何影响大模型的持续后训练,识别出“几何冲突”是导致遗忘的原因,也是控制更新整合的机制。作者提出了一种无需数据的方法——几何冲突 Wasserstein 合并(GCWM),该方法在各种规模的模型中均能提升保留率和性能。

面向长周期LLM智能体的选择性记忆保留

arXiv cs.AI

本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。

重新思考持续学习中的迁移:一种基于回放的实现方式

arXiv cs.LG

本文介绍了一个框架,用于判断在持续学习中何时应该期待迁移,并提出了选择性回放迁移(TSR),该机制选择预计对当前任务有益的回放数据,而非不加区分地回放过去的示例。TSR在保持稳定性的同时改善了前向迁移,优于现有的回放基线。

干扰感知的多任务机器遗忘

arXiv cs.AI

本文介绍了一种干扰感知的多任务机器遗忘框架,通过任务感知的梯度投影和实例级别的梯度正交化来解决任务级和实例级干扰,在多任务计算机视觉基准上实现了有效的遗忘。