元可塑性作为增量学习中的自适应梯度预处理

arXiv cs.LG 论文

摘要

SynGAP 是一个无任务持续学习框架,通过自适应梯度预处理模拟生物元可塑性,以缓解灾难性遗忘,在基准测试中显示出相对于现有方法的显著准确性提升。

arXiv:2608.14634v1 公告类型:新 摘要:生物智能通过互补学习系统(CLS)理论自然地防止灾难性遗忘,这是一个在局部由突触元可塑性驱动的宏观巩固过程:单个突触的连续、历史依赖的神经调节。虽然人工神经网络在非平稳环境中难以应对稳定性-可塑性困境,但现有解决方案通常需要任务标签或产生巨大的内存开销,偏离了生物现实。将这种局部神经调节重新框架为一个优化驱动的过程,我们引入了 $\textbf{SynGAP}$:$\textbf{Syn}$aptic $\textbf{G}$eometric $\textbf{A}$daptive $\textbf{P}$reconditioning。SynGAP 是一个基于自适应梯度预处理的无任务持续学习框架。SynGAP 不依赖于显式的事件触发器,而是通过维护连续数据流上 Fisher 信息矩阵的指数移动平均来模拟实时元可塑性。在优化步骤中,这些动态元可塑状态被转换为一个有界的乘性掩码,用于预处理原始梯度,选择性衰减对关键历史参数的更新。实证评估表明,与现有基线相比,SynGAP 在缓解灾难性遗忘方面具有卓越能力。在 Split CIFAR-100 基准测试中,SynGAP 相比 EWC++ 带来 $4\times$ 的准确性提升,并且比 Experience Replay (ER) 高出近 $10\%$,同时针对两种方法将遗忘度量降低超过 $10\%$。此外,在 CORe50 基准测试中,SynGAP 达到约 $68\%$,比优化器基线提高了 $10\%$。通过将连续生物元可塑性数学化为稳定的基于梯度的正则化,SynGAP 为边缘的自适应智能提供了一个高度鲁棒且内存高效的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:17

# 元可塑性作为增量学习的自适应梯度预条件化
来源:https://arxiv.org/html/2608.14634
###### 摘要

生物智能通过互补学习系统(CLS)理论自然地防止灾难性遗忘,这是一个宏观的巩固过程,在局部层面由突触元可塑性驱动:即单个突触的持续、历史依赖性神经调制。尽管人工神经网络在非平稳环境中面临稳定性-可塑性困境,但现有解决方案通常需要任务标签或带来巨大的内存开销,偏离了生物现实。我们将这种局部神经调制重新定义为一个优化驱动的过程,引入了SynGAP:突触几何自适应预条件化。SynGAP是一种基于自适应梯度预条件化的无任务持续学习框架。SynGAP不依赖于显式的事件触发,而是通过维护费舍尔信息矩阵在连续数据流上的指数移动平均来模拟实时的元可塑性。在优化步骤中,这些动态的元可塑性状态被转换为一个有界的乘性掩码,该掩码预处理原始梯度,选择性地衰减对关键历史参数的更新。实证评估表明,与现有基线相比,SynGAP在缓解灾难性遗忘方面具有卓越的能力。在Split CIFAR-100基准测试中,与EWC++相比,SynGAP的准确率提高了4倍,比经验回放(ER)高出近10%,同时将两种方法的遗忘度量均降低了10%以上。此外,在CORe50基准测试上,SynGAP实现了约68%的准确率,比优化器基线提高了10%。通过将连续的生物元可塑性数学形式化为基于梯度的稳定正则化,SynGAP为边缘自适应智能提供了一种高度稳健且内存高效的解决方案。

## 引言

生物智能建立在持续学习的能力之上,能够适应非平稳的环境刺激流,而不会灾难性地遗忘先前获得的知识。在人工神经网络(ANNs)中,这种稳定性-可塑性困境仍然是一个基本挑战(Kudithipudi等人,2022(https://arxiv.org/html/2608.14634#bib.bib1))(图1(https://arxiv.org/html/2608.14634#Sx1.F1)a)。标准梯度下降算法为即时性能而近视地优化参数,覆盖了对历史任务至关重要的潜在表征,导致被称为灾难性遗忘的现象(McCloskey和Cohen,1989(https://arxiv.org/html/2608.14634#bib.bib2);French,1999(https://arxiv.org/html/2608.14634#bib.bib48))。互补学习系统(CLS)理论提出,大脑通过系统巩固来解决稳定性-可塑性困境,其中海马体作为新信息的快速缓冲区,随后将其整合到新皮层中(O'Reilly等人,2014(https://arxiv.org/html/2608.14634#bib.bib3))。这种逐渐的整合可能在细胞水平上由元可塑性,或“突触可塑性的可塑性”所控制(Fusi等人,2005(https://arxiv.org/html/2608.14634#bib.bib4);Jedlicka等人,2022(https://arxiv.org/html/2608.14634#bib.bib15))(图1(https://arxiv.org/html/2608.14634#Sx1.F1)b, c)。

深度学习架构采用了基于架构、回放或正则化的策略来促进持续学习(Wang等人,2024(https://arxiv.org/html/2608.14634#bib.bib55))。然而,这些范式经常偏离生物约束(Hess等人,2023(https://arxiv.org/html/2608.14634#bib.bib56)):
- 架构和参数隔离方法通常受到容量限制,或者需要显式的任务边界来分配新的子网络。
- 基于回放的框架虽然经验上鲁棒,但通过事件缓冲区施加了巨大的内存开销,并且由于突然的分布偏移,在任务过渡边界处存在“稳定性间隙”。
- 正则化技术,如弹性权重巩固(EWC)(Kirkpatrick等人,2017(https://arxiv.org/html/2608.14634#bib.bib8)),通过费舍尔信息矩阵(FIM)捕捉历史损失曲面的几何结构。然而,这些方法通常需要显式的任务ID来在不同训练阶段结束时计算和冻结重要性指标,依赖于扭曲全局优化曲面的加性损失惩罚。

在本工作中,我们认为突触元可塑性可以数学地重新构建为一种规范性的、几何感知的优化策略。持续学习代理不是回顾性地评估参数的重要性,而是将优化视为通过部分可观察黎曼流形的导航(Vastola等人,2025(https://arxiv.org/html/2608.14634#bib.bib6))。在这个空间中,局部曲率对应于过去数据的关键结构知识。标准随机梯度下降(SGD)在欧几里得空间中近视地运行。通过盲目跟随当前刺激的最陡下降,它沿着不同的损失曲率方向剧烈地移动参数(Kingma和Ba,2015(https://arxiv.org/html/2608.14634#bib.bib35);Cheng等人,2025(https://arxiv.org/html/2608.14634#bib.bib52))。我们证明,它也可以通过调整这些变化的损失曲率来加速收敛(Kingma和Ba,2015(https://arxiv.org/html/2608.14634#bib.bib35);Cheng等人,2025(https://arxiv.org/html/2608.14634#bib.bib52))。我们证明它可以服务于一个关键的逆向目标。通过实时映射联合任务的参数空间几何结构,预条件化可以作为持续学习的结构稳定器。

图注图1:平衡稳定性-可塑性困境需要元可塑性控制。(a)传统学习导致旧任务(任务A)的灾难性遗忘,其中新任务(任务B)的引入在可塑性谱上引起不稳定的平衡。(b)为了对抗这一点,元可塑性机制在保持两个任务的跷跷板上移动学习的“支点”,平衡旧知识的巩固与新信息的吸收。(c)在网络层面,这是通过在突触处进行局部梯度流调制来实现的。作为一个自适应阀门,元可塑性调节梯度更新,以确定沿可塑性谱的最平衡位置。
基于这种几何直觉,我们引入了突触几何自适应预条件化(SynGAP),一种基于梯度的、无任务的持续学习框架。SynGAP在没有显式事件触发的情况下运行,通过在连续数据流上维护FIM的在线指数移动平均来模拟持续的神经调制。在每个优化步骤中,这种对历史损失曲面的动态近似被映射到一个有界的乘性掩码。这种掩码不是通过加性惩罚来改变全局损失函数,而是直接预处理原始随机梯度,在几何上衰减高历史曲率方向上的更新向量,同时保持沿平坦、非干扰参数轨迹的可塑性。

SynGAP通过对其预条件化掩码施加严格的数学边界来平衡稳定性-可塑性权衡,从而系统地防止影响刚性正则化方法的可塑性丧失或参数不屈服性。通过将生物元可塑性与黎曼参数空间几何结构统一起来,SynGAP避免了事件数据回放的严重内存负担,并且仅依赖于一个小的事件缓冲区。我们的框架为边缘的持续自适应智能提供了一个高度鲁棒、计算轻量级的优化器。

我们的核心贡献结构如下:
- 我们将生物元可塑性数学形式化为梯度预条件化问题。
- 我们提出了SynGAP优化器,它可以在不需要任务边界或产生广泛数据存储开销的情况下,持续跟踪跨非平稳数据流的参数重要性。
- 我们引入了一个有界的乘性掩码机制,明确地维护参数可塑性,为网络冻结提供保障。

图注图2:SynGAP。(a)为了实现持续学习成功,模型必须优化所有任务的联合损失。(b)朴素优化在寻找多任务持续学习的联合最小值时很困难,因为更新是在最新任务数据上全局执行的。(c)SynGAP引入了由函数g(F)g(\textbf{F})控制的局部元可塑性更新,该函数基于联合损失的费舍尔信息调制优化步骤。该图是借助Gemini 3制作的。

## 相关工作

### 通过参数正则化的持续学习

缓解灾难性遗忘的一个常见策略是参数正则化,旨在通过限制单个权重对先前学习任务的估计重要性来限制其可塑性,从而促进持续学习。这些方法通常在全局损失函数上附加一个惩罚项,温和地将更新的权重拉回其巩固的值。这些方法之间的主要区别在于它们如何估计参数重要性。EWC(Kirkpatrick等人,2017(https://arxiv.org/html/2608.14634#bib.bib8))利用经验FIM的对角线来衡量局部参数敏感性,但需要严格的任务ID和真实标签访问权限。突触智能(SI)(Zenke等人,2017(https://arxiv.org/html/2608.14634#bib.bib9))在训练期间持续跟踪梯度的路径积分,记忆感知突触(MAS)(Aljundi等人,2018(https://arxiv.org/html/2608.14634#bib.bib10))使用网络输出函数的梯度,从而增加了无监督的参数重要性估计。更近期的,基于测试时适应的方法,如高效抗遗忘测试时适应(EATA)(Niu等人,2022(https://arxiv.org/html/2608.14634#bib.bib72)),通过使用伪标签估计费舍尔信息并主动过滤高熵样本以减少反向传播的计算开销,将此范式扩展到无标签的流式环境。

尽管被广泛采用且最近进行了高效推理的适应,正则化方法通常依赖于损失函数的事后加性惩罚,随着任务数量的增加,这在优化过程中可能导致缩放问题。通过将巩固视为静态约束而非主动学习过程的动态属性,这些方法通常面临保留过去知识和适应新数据分布之间的权衡(Dohare等人,2024(https://arxiv.org/html/2608.14634#bib.bib27))。这种局限性突出了需要直接干预优化步骤的方法,从全局损失惩罚转向将内存保护无缝嵌入网络的更新动态中。

### 梯度修改与预条件化

超越静态损失惩罚,梯度预条件化方法通过基于历史梯度或损失几何结构缩放权重更新来直接干预优化动态(Kingma和Ba,2015(https://arxiv.org/html/2608.14634#bib.bib35);Amari,1998(https://arxiv.org/html/2608.14634#bib.bib63))。最近的进步包括梯度投影技术,它沿着与旧任务梯度正交的方向更新模型以最小化干扰(Farajtabar等人,2020(https://arxiv.org/html/2608.14634#bib.bib73))。为了缓解严格正交性的刚性,缩放梯度投影(SGP)将正交投影与沿过去核心梯度空间的缩放更新相结合(Saha和Roy,2023(https://arxiv.org/html/2608.14634#bib.bib74))。SGP通过对输入表征进行奇异值分解(SVD)来计算这种基重要性,绕过了数据回放的需要(Saha等人,2021(https://arxiv.org/html/2608.14634#bib.bib75))。

然而,这些方法面临严重的计算瓶颈,特别是在低功耗边缘应用中限制了其可行性。标准优化器使用会迅速覆盖历史重要性的瞬态缩放因子。相反,严格的投影方法如SGP需要通过SVD(Saha等人,2021(https://arxiv.org/html/2608.14634#bib.bib75))连续计算和操作大型基矩阵,产生高昂的全局开销。因此,该领域缺乏一种局部的、永久有状态的机制,可以在不需要昂贵数学操作的情况下,将持久的内存保护直接嵌入梯度更新中。借鉴神经科学,这一缺口自然指向了生物突触中观察到的复杂的、历史依赖性的元可塑性。

### 生物元可塑性

为了克服瞬态优化器和计算上昂贵的曲率矩阵的局限性,最近的持续学习架构从大脑的互补学习系统(CLS)(O'Reilly等人,2014(https://arxiv.org/html/2608.14634#bib.bib3);Pham等人,2021(https://arxiv.org/html/2608.14634#bib.bib76))和“复杂”突触的微观层面动力学中汲取灵感。在生物网络中,隐藏的内部状态决定了突触的元可塑性(“其可塑性的可塑性”),确保先前的巩固在结构上为未来的改变易感性预设了条件(Benna和Fusi,2016(https://arxiv.org/html/2608.14634#bib.bib14);Fusi等人,2005(https://arxiv.org/html/2608.14634#bib.bib4))。尽管一些持续学习方法已经将此概念转化为人工神经网络(Aguilar等人,2025(https://arxiv.org/html/2608.14634#bib.bib16);Laborieux等人,2021(https://arxiv.org/html/2608.14634#bib.bib51)),但它们不是与架构无关的,并且受到容量瓶颈的影响,无法捕捉复杂的高维分布或大规模任务。因此,缺乏一种连续的、与模型无关的且高度可扩展的元可塑性框架。

## 预备知识

#### 持续学习设置。

在标准的基于任务的持续学习(CL)中,模型在任务序列T=\{T1,T2,...,TT\}\mathcal\{T\}=\{T\_\{1\},T\_\{2\},\dots,T\_\{T\}\}(Mirzadeh等人,2020(https://arxiv.org/html/2608.14634#bib.bib40))上进行训练。每个任务TtT\_\{t\}关联一个特定的数据集Dt=\{(xit,yit)\}i=1Nt\mathcal\{D\}\_\{t\}=\{(x\_\{i\}^\{t\},y\_\{i\}^\{t\})\}\_\{i=1\}^\{N\_\{t\}\}, 其中xit∈Xx\_\{i\}^\{t\}\in\mathcal\{X\}代表一个输入样本,yit∈Yy\_\{i\}^\{t\}\in\mathcal\{Y\}是对应的标签,它们来自任务特定的数据分布Pt(X,Y)P\_\{t\}(X,Y)。

在任务TtT\_\{t\}的训练阶段,模型只能访问当前数据集Dt\mathcal\{D\}\_\{t\}。访问先前任务的数据通常限于一个小的记忆缓冲区。在tt个任务上训练后的总体目标是找到使迄今为止所有观测任务的期望风险最小化的最优参数θθ:
minθ∑k=1tE(x,y)∼Pk[L(fθ(x),y)]\min\_\{\theta\}\sum\_\{k=1\}^\{t\}\mathbb\{E\}\_\{(x,y)\sim P\_\{k\}\}[\mathcal\{L\}(f\_\{\theta\}(x),y)](1)
其中fθf\_\{\theta\}是由θθ参数化的神经网络,L\mathcal\{L\}是一个标准的损失函数(这里,我们使用交叉熵)。这种设置下的根本挑战是成功学习分布PtP\_\{t\}。

相似文章

通过梯度手术的持续学习低秩适配器初始化

arXiv cs.LG

该论文提出了Slice,一种基于梯度手术的LoRA适配器初始化方法,用于持续学习,通过调和当前任务和过去任务的冲突梯度来减少灾难性遗忘,实现了更好的稳定性-可塑性权衡。

可检索梯度:无累积权重漂移的持续后训练

arXiv cs.CL

提出 ReGrad,一种将梯度视为可检索知识单元用于持续后训练的范式,通过将文档特定梯度存储在梯度银行(Gradient Bank)中,并在推理时检索查询相关梯度进行临时权重适应,从而避免累积权重漂移。