快速与慢速变分持续学习

arXiv cs.LG 论文

摘要

本文介绍了持续IVON(CoVON)优化器,它将快速和慢速适应整合到变分持续学习中,以平衡稳定性和可塑性,在领域增量学习、持续预训练以及大型语言模型的微调中优于现有方法。

arXiv:2606.24007v1 公告类型:新 摘要:持续学习仍然是现代深度网络的一个主要挑战,部分原因是常用的优化器缺乏持续适应的内在机制。其中一个自然机制是快速和慢速适应,以平衡稳定性和可塑性。这种机制在神经科学和生物学中有深厚根源,但关于如何最好地将其纳入常用优化器尚无共识。在这里,我们展示了通过VCL框架可以轻松实现这一点,其中过去的后验被用作未来的先验。我们的关键思想是通过合并过去的后验来实现慢速适应,从而在学习过程中减缓知识的漂移。合并后的后验然后用作VCL更新中的先验,以实现快速权重更新。这些步骤可以在IVON优化器中无缝实现,其形式和成本几乎与Adam相同。我们将这种新优化器称为持续IVON(CoVON)优化器,并表明它不仅持续优于现有的VCL优化器,而且在领域增量学习、持续预训练和大型语言模型微调中表现优于其他权重正则化策略。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:50

# 快速与缓慢变分持续学习
来源:https://arxiv.org/html/2606.24007  
Subarnaduti Paul¹, Yohan Jung², Mohammad Emtiyaz Khan³,⁴,⁵, Siddharth Swaroop⁶, Thomas Möllenhoff⁴, Martin Mundt¹  
¹不莱梅大学数学与计算机科学学院,德国不莱梅  
²全北国立大学计算机科学与人工智能系,韩国  
³达姆施塔特工业大学计算机科学系,德国达姆施塔特  
⁴RIKEN 高级智能项目中心,日本东京  
⁵黑森州人工智能中心 (hessian.AI),德国达姆施塔特  
⁶伦敦大学学院,英国  
{spaul, mundtm}@uni-bremen.de  

###### 摘要  

持续学习仍然是现代深度网络面临的主要挑战,部分原因是常用的优化器缺乏持续适应的固有机制。其中一种自然机制是“快速与缓慢适应”,用以平衡稳定性和可塑性。该机制在神经科学和生物学中有深厚根源,但关于如何将其最好地整合到常用优化器中尚未达成共识。本文表明,通过 VCL 框架可以轻松实现这一点,其中过去的后验被用作未来的先验。我们的关键思想是通过合并过去的后验来实现缓慢适应,从而在学习过程中减缓知识的漂移。合并后的后验随后被用作 VCL 更新中的先验,以实现快速权重更新。这些步骤可以无缝地在 IVON 优化器中实现,其形式和成本几乎与 Adam 相同。我们将这种新优化器称为 Continual IVON (CoVON) 优化器,并表明它不仅持续优于现有的 VCL 优化器,而且在域增量学习、持续预训练以及大型语言模型微调中,性能也优于其他权重正则化策略。  

## 1 引言  

现代深度学习系统,尤其是大型语言模型 (LLMs),越来越多地部署在非平稳环境中,数据和任务随时间演变 (Silver and Sutton, 2025 (https://arxiv.org/html/2606.24007#bib.bib1030))。这正是持续学习和终身学习的核心问题 (Thrun, 1998 (https://arxiv.org/html/2606.24007#bib.bib895); Hadsell et al., 2020 (https://arxiv.org/html/2606.24007#bib.bib828)),其基本挑战在于顺序更新这些模型而不灾难性地干扰先前学到的知识。遗忘的部分原因是标准优化器(如 SGD 和 Adam)并非设计用于处理非平稳环境,因此没有内置机制来保留旧知识。结果,持续学习被视为一个附加问题,通常通过外部正则化 (Kirkpatrick et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib814); Zenke et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib873); Lee et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib886))、经验或数据回放 (Rebuffi et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib952); Rolnick et al., 2019 (https://arxiv.org/html/2606.24007#bib.bib1026); Lopez-Paz and Ranzato, 2017 (https://arxiv.org/html/2606.24007#bib.bib948)) 或架构组件的隔离 (Rusu et al., 2016 (https://arxiv.org/html/2606.24007#bib.bib887); Yoon et al., 2018 (https://arxiv.org/html/2606.24007#bib.bib879); Mitchell et al., 2024 (https://arxiv.org/html/2606.24007#bib.bib880)) 来解决,完整概述参见综述 (Mundt et al., 2023 (https://arxiv.org/html/2606.24007#bib.bib897); Wang et al., 2024a (https://arxiv.org/html/2606.24007#bib.bib898))。这是一种处理遗忘的相当复杂的方式。理想情况下,我们希望知识保留天然植根于优化过程本身,使得优化器能够自然地平衡对当前任务的有效适应和对先前知识的谨慎保留。  

一种自然平衡这种稳定性-可塑性的方法是使用快速与缓慢适应。本质上,我们希望在两个不同的时间尺度上操作学习:一个快速组件能够迅速适应新数据,一个缓慢组件则巩固并保留先前获得的知识。这源于神经科学中的互补学习系统 (CLS) 理论 (McClelland et al., 1995 (https://arxiv.org/html/2606.24007#bib.bib882); O'Reilly and Norman, 2002 (https://arxiv.org/html/2606.24007#bib.bib883)),其中海马体与快速适应相关,新皮层与缓慢巩固相关。受此观点启发,许多持续学习工作已从 CLS 理论中获得松散灵感。然而,以往工作并非将快速与缓慢动态明确地纳入单一模型的优化中,而是隐含地利用它来指导结构或记忆的设计 (Dorovatas et al., 2026 (https://arxiv.org/html/2606.24007#bib.bib945))。例如,它们关注生成模型与判别模型(新皮层与海马体)之间的相互作用,并带有回放机制 (Shin et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib947); Van de Ven et al., 2020 (https://arxiv.org/html/2606.24007#bib.bib899); Lee et al., 2016 (https://arxiv.org/html/2606.24007#bib.bib313)),以及将参数分离成不相交的集合 (Pham et al., 2021 (https://arxiv.org/html/2606.24007#bib.bib885); Arani et al., 2022 (https://arxiv.org/html/2606.24007#bib.bib889); Lee et al., 2024 (https://arxiv.org/html/2606.24007#bib.bib888))。关于直接将此类更新纳入持续学习优化器的工作很少,到目前为止,对于如何将此特性添加到常用优化器中还没有共识。  

在本工作中,我们采取不同的视角,展示快速与缓慢适应可以自然地实现在变分持续学习 (VCL) 框架中 (Nguyen et al., 2018 (https://arxiv.org/html/2606.24007#bib.bib806))。该框架使用过去的后验作为先验分布来更新新的后验。我们表明,缓慢权重更新可以通过旧后验的“后验合并”来实现,本质上以一种不确定性加权的方式在观察新任务时减缓知识的漂移。借助这个缓慢移动的先验,快速权重更新通过 VCL 目标来实现。为此,我们使用一个最近提出的变分训练算法,称为改进的变分在线牛顿优化器 (Shen et al., 2024 (https://arxiv.org/html/2606.24007#bib.bib17)),该算法使用对角高斯后验,其形式和成本几乎与 Adam 相同。我们将这种新算法称为 Continual IVON (CoVON)。在这里,我们通过经典域增量学习、持续预训练以及大型语言模型微调的各种实验,展示了 CoVON 相对于现有 VCL 及其他权重正则化策略在持续学习中的优势。  

参考说明  
Figure 1: CoVON 通过单个模型中的快速与缓慢适应步骤平衡变分持续学习中的稳定性和可塑性,其中 VCL 块表示方程 1 (https://arxiv.org/html/2606.24007#S2.E1) 中的变分更新。缓慢移动的后验(红色)缓慢地整合来自先前后验和新快速后验(蓝色)的信息,将模型合并在一起。快速后验使用先前缓慢后验作为新的先验,在贝叶斯持续更新中对当前数据进行训练。  

## 2 背景与相关工作  

神经网络的持续学习算法必须平衡互补的特性:*可塑性*,即快速适应新任务而不丧失学习能力;以及*稳定性*,即保留先前任务中获得的知识而不发生灾难性遗忘。平衡这两者的一个自然机制是“快速与缓慢适应”,其中可塑性通过快速移动的组件维持,稳定性则保留在缓慢移动的部分。然而,大多数流行的持续学习方法试图通过添加到标准训练流程之上的外部机制来平衡这些特性。这些方法包括基于正则化、基于回放/记忆和基于架构的方法,完整概述参见综述 (Mundt et al., 2023 (https://arxiv.org/html/2606.24007#bib.bib897); Wang et al., 2024a (https://arxiv.org/html/2606.24007#bib.bib898))。这些方法试图纠正当前优化算法(如 SGD 和 AdamW (Loshchilov and Hutter, 2019 (https://arxiv.org/html/2606.24007#bib.bib58)))的一个更广泛的局限性:虽然它们能有效学习当前任务,但并未明确随时间保存知识,对稳定性-可塑性权衡的平衡有限,最终导致灾难性遗忘 (Mirzadeh et al., 2020 (https://arxiv.org/html/2606.24007#bib.bib1010))。  

其他近期工作引入了简单的方法,没有外部机制,且与现有的深度学习优化器类似:Li et al. (2025 (https://arxiv.org/html/2606.24007#bib.bib1017)) 提出重用 AdamW 的尺度向量进行持续学习,但这在较大批量大小下可能不准确。Utility-Perturbed Gradient Descent (UPGD) (Elsayed and Mahmood, 2024 (https://arxiv.org/html/2606.24007#bib.bib1029)) 引入了一种持续优化器,但它依赖于二阶导数计算,难以扩展到现代更大规模的神经网络。在本工作中,我们引入了一个简单的标准训练流程,在优化步骤中以在线方式计算二阶估计,且没有显著开销,从而支持大规模下的持续适应。  

我们可以不寻找可能平衡或不平衡快速适应与缓慢巩固的外部机制,而是直接使用以两种不同节奏运行的学习动态。这在神经科学中已有研究,并用于激发机器学习算法。McClelland et al. (1995 (https://arxiv.org/html/2606.24007#bib.bib882)) 提出的互补学习系统 (CLS) 神经科学理论认为,人脑通过海马体和新皮层依赖快速和缓慢学习。受此 CLS 观点启发的持续学习工作,却使用了启发式方法。它们要么显式使用两组权重,要么使用双系统机制;包括 CLS-ER (Arani et al., 2022 (https://arxiv.org/html/2606.24007#bib.bib889))、Dual-Nets (Pham et al., 2021 (https://arxiv.org/html/2606.24007#bib.bib885))、基于 RL 的 CLS (Lee et al., 2024 (https://arxiv.org/html/2606.24007#bib.bib888)) 和 MERLIN (Joseph and Balasubramanian, 2020 (https://arxiv.org/html/2606.24007#bib.bib884))。相比之下,我们自然地将快速和缓慢更新纳入单一模型的优化过程中。  

另一条工作线受到突触快速与缓慢更新的生物学观点启发 (Hinton and Plaut, 1987 (https://arxiv.org/html/2606.24007#bib.bib825)),使用快速权重来去模糊存储在缓慢移动权重中的压缩记忆。这一观点后来被重新审视,用于加速深度学习中的优化 (Zhang et al., 2019 (https://arxiv.org/html/2606.24007#bib.bib698))、序列建模 (Ba et al., 2016 (https://arxiv.org/html/2606.24007#bib.bib890))、元学习 (Finn et al., 2017 (https://arxiv.org/html/2606.24007#bib.bib1034); Nichol et al., 2018 (https://arxiv.org/html/2606.24007#bib.bib1033)),以及最近的持续学习 (Abbes et al., 2025 (https://arxiv.org/html/2606.24007#bib.bib1035))。我们的工作提出了这种观点的变分贝叶斯表述,以及对高斯后验的可扩展实现,从而给出了这些方法的新的曲率加权变体。  

在这里,我们的目标是展示如何在 VCL 框架中自然地实现快速与缓慢适应 (Nguyen et al., 2018 (https://arxiv.org/html/2606.24007#bib.bib806))。与旨在通过最小化损失函数 lt(θ)=∑i∈Dtli(θ)/|Dt| 来寻找参数 θ 的标准训练方法不同,VCL 旨在通过优化 KL 散度目标来找到分布 q(θ),其中以过去的后验 qt-1 作为任务 t 的先验。优化过程如下:  
qt(θ) ← arg min_{q∈Q} λt E_{q(θ)}[lt(θ)] + D_KL(q(θ) ∥ q_{t-1}(θ)).   (1)  
可以证明,通过某些近似,标准优化器的解可以作为该目标的特例恢复。与原始的 VCL 工作相反,我们引入了一个缩放因子 λt > 0,当设置为数据样本数 |Dt| 时,恢复 VCL。尽管 VCL 由于贝叶斯更新结构在持续学习中表现尚可,但它没有快速和缓慢更新的概念:只有一组权重使用相同的优化过程进行更新。这意味着在快速适应和缓慢巩固之间没有明确的权衡。Nguyen et al. (2018 (https://arxiv.org/html/2606.24007#bib.bib806)) 认为 VCL 由于贝叶斯更新自动满足这一点;然而在实践中,由于神经网络所需的近似(如平均场高斯近似),VCL 的性能会迅速下降。在我们的方法中,我们将引入一个单独的缓慢更新,以自然包含快速和缓慢动态。接下来我们描述如何构建在 VCL 之上。  

## 3 通过持续变分在线牛顿法 (CoVON) 实现快速与缓慢 VCL  

现在我们将展示如何在 VCL 框架中自然地实现快速与缓慢机制,其中快速适应控制新任务上的可塑性,缓慢适应巩固从过去任务中获得的先验知识。我们首先在第 3.1 节 (https://arxiv.org/html/2606.24007#S3.SS1) 描述通用框架,然后给出两种可扩展实现,使用对角高斯后验:一种使用 AdamW 的朴素近似,以及我们完整的 CoVON 算法(使用 IVON)。  

### 3.1 快速与缓慢变分持续学习  

我们建议将 VCL 推广为两阶段的快速与缓慢更新(另见图 1 (https://arxiv.org/html/2606.24007#S1.F1)),其中 (1) 使用方程 1 学习快速适应的每个任务后验,然后 (2) 将其巩固到一个缓慢移动的外部后验中,该后验通过合并过去信息与新信息获得。对于快速适应,我们使用方程 1,优化 qt^fast,同时将先验设置为 q_{t-1}^slow。  

缓慢适应:在学到当前任务的快速后验 qt^fast 后,我们通过将其与之前的缓慢移动后验 q_{t-1}^slow 以及新学到的后验 qt^fast 合并,来巩固到一个缓慢移动的外部后验中:  
q_t^slow(θ) ∝ q_{t-1}^slow(θ) (qt^fast(θ) / q_{t-1}^slow(θ))^γ.   (2)  
这种更新选择使我们能够更好地

相似文章

转型中的持续学习

Hugging Face Daily Papers

本文综述了持续学习从参数中心方法向系统级适应的演变,提出了一个三轴框架(何时、如何、何地)来刻画预训练、后训练和推理阶段的学习。

学习,快与慢:走向持续适应的LLMs

Hugging Face Daily Papers

一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。

面向大型语言模型归因引导的持续学习

arXiv cs.LG

本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。

变分选项发现算法

OpenAI Blog

OpenAI研究人员提出了VALOR,这是一种用于选项发现的变分推断方法,它将选项学习与变分自编码器联系起来,并提出了一种课程学习方法,通过动态增加上下文复杂性来稳定训练。