漂移与依赖:基于回放的持续学习的逐层信息论界

arXiv cs.LG 论文

摘要

本文提出了一个针对基于回放的持续学习的逐层信息论框架,将泛化差距分解为回放引起的表示漂移项和优化依赖项,并通过Wasserstein松弛与SGLD实例化对其进行了细化。

arXiv:2608.11690v1 公告类型:新 摘要:持续学习必须在吸收新任务的同时不遗忘旧任务,而回放——将过去样本的小缓冲区混入当前训练——是缓解灾难性遗忘最有效的方法之一。然而,其泛化行为受到两种耦合效应的影响,现有分析将这些效应归结为单一假设层面的量:有限记忆用经验代理替换每个过去的分布,而重复使用通过共享的优化轨迹将缓冲区、当前数据和最终假设耦合在一起。我们开发了一个逐层信息论框架,在每个深度上区分这些效应。我们的主要结果将期望泛化差距分解为回放引起的表示漂移项和优化依赖项,后者进一步分解为稳定性、可塑性、交互和残差耦合组件。两个改进使该框架变得可操作。漂移项的Wasserstein松弛在支撑不匹配下有效,产生了一个深度相关的漂移-灵敏度权衡,其最小化器确定了应稳定哪个内部层。优化项的SGLD实例化将其简化为轨迹级别的对数行列式预算,揭示了一个曲率感知的梯度对齐统计量,可作为任务级遗忘的在线诊断指标。受控和基准实验证实了预测的记忆缩放、内部漏斗效应以及对齐信号与遗忘之间的联系。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:38

# 漂移与依赖:基于回放的持续学习的逐层信息论界
Source: https://arxiv.org/html/2608.11690
Zhongbo Zhang,Wen Wen,Yong-Jin Liu
致谢:本工作得到国家自然科学基金(批准号:62576268)、中央高校基本科研业务费以及陕西省重点研发计划项目(编号:2024PT-ZCK-89)的资助。(通信作者:Tieliang Gong。)
致谢:Tieliang Gong、Zhongbo Zhang和Wen Wen就职于西安交通大学计算机科学与技术学院(电子邮件:[email protected];[email protected];[email protected])。
致谢:Yong-Jin Liu就职于清华大学计算机科学与技术系(电子邮件:[email protected])

###### 摘要
持续学习必须在不遗忘旧任务的情况下吸收新任务,而回放——将一小部分过去样本的缓冲区混入当前训练——是缓解灾难性遗忘最有效的方法之一。然而,其泛化行为受到两种耦合效应的影响,而现有分析将这些效应并入一个单一假设级量:有限记忆将每个过去分布替换为经验代理,而反复复用通过共享的优化轨迹将缓冲区、当前数据和最终假设耦合在一起。我们开发了一个逐层信息论框架,在每一深度分离这些效应。我们的主要结果将期望泛化差距分解为回放引起的表示漂移和优化依赖项,后者进一步分解为稳定性、可塑性、交互和残差耦合成分。两个改进使该框架可操作。漂移项的Wasserstein松弛在支持不匹配下有效,产生深度相关的漂移–敏感性权衡,其最小化器确定应稳定哪个内部层。优化项的SGLD实例化将其简化为轨迹级对数行列式预算,揭示了一个曲率感知的梯度对齐统计量,可作为任务级遗忘的在线诊断。受控和基准实验证实了预测的记忆缩放、内部漏斗以及对齐信号与遗忘之间的联系。

###### 关键词:持续学习、经验回放、信息论、Wasserstein距离、随机梯度Langevin动力学。

## I引言
持续学习(CL)研究模型如何逐步学习一系列任务,同时保留从先前任务中获得的知识[21 (https://arxiv.org/html/2608.11690#bib.bib12),31 (https://arxiv.org/html/2608.11690#bib.bib1),8 (https://arxiv.org/html/2608.11690#bib.bib2)]。持续学习的一个核心障碍是灾难性遗忘:当模型适应新任务时,其在早期任务上的性能可能显著下降[29 (https://arxiv.org/html/2608.11690#bib.bib22),14 (https://arxiv.org/html/2608.11690#bib.bib3)]。近年来,人们为缓解灾难性遗忘做了大量努力[20 (https://arxiv.org/html/2608.11690#bib.bib5),24 (https://arxiv.org/html/2608.11690#bib.bib6)]。其中,基于回放的方法[36 (https://arxiv.org/html/2608.11690#bib.bib13),33 (https://arxiv.org/html/2608.11690#bib.bib14),16 (https://arxiv.org/html/2608.11690#bib.bib7)]已成为最成功的实用机制之一,学习者存储一小部分过去样本的缓冲区,并在训练期间将其与当前任务混合。尽管取得了这一成功,基于回放的持续学习的泛化行为仍未得到充分理解,因为回放改变了被优化的统计对象。学习者从未最小化针对过去任务总体的风险;它最小化针对这些总体的有限代理的风险,并且随着模型继续演化而反复这样做。这种替代通过两个渠道起作用。首先,用有限的存储子集替换总体会产生代理偏差;例如,缓冲区上的经验目标只是总体目标的偏差代表,并且这种偏差不会仅仅因为数据是i.i.d.而消失。其次,在许多更新中重复使用相同的存储样本会在旧样本、当前样本和最终假设之间产生依赖耦合,因为三者通过共享的优化轨迹联系在一起。请注意,这两个渠道都不预设模型学习表示,并且当回放直接在原始输入上执行时,两者都已存在。深度网络增加的不是第三个渠道,而是这两个渠道随深度行为的变化,并且这种变化是不对称的。由于缓冲区仅通过学习的特征图影响后续任务,并且由于该特征图是拟合到特定存储样本上的,代理偏差不再是固定的:它在每一层生成并重塑,并且在输入空间中可忽略的差异可能被其上方的子网络放大。相比之下,依赖耦合由算法对数据的复用决定,即使没有学习表示也存在。因此,学习的表示将代理偏差转变为深度相关的对象,同时使耦合渠道基本不变。正如我们界的边界情况所精确指出的,代理偏差渠道在输入层消失并随深度增长,而耦合渠道即使在那里也存在。现有理论并不分离这些渠道。

基于回放损失、权衡参数或领域自适应论证的分析[35 (https://arxiv.org/html/2608.11690#bib.bib8),40 (https://arxiv.org/html/2608.11690#bib.bib9)]将学习完整数据流的固有难度与将其压缩到缓冲区中的近似成本混在一起,因此有限容量损失和复用引起的依赖性从未作为独立量出现。经典复杂度界也好不了多少:它们的容量项远快于样本量增长,在恰是我们关注的过参数化区域中数值上空洞。在光滑性或Lipschitz假设下的稳定性和收敛性分析[23 (https://arxiv.org/html/2608.11690#bib.bib10),22 (https://arxiv.org/html/2608.11690#bib.bib11)]采取相反的策略——它们紧密跟踪优化动态,但很少说明缓冲区大小、序列长度、深度和算法依赖性如何共同影响差距。信息论框架最为接近:它通过互信息及其改进形式[50 (https://arxiv.org/html/2608.11690#bib.bib18),44 (https://arxiv.org/html/2608.11690#bib.bib19),17 (https://arxiv.org/html/2608.11690#bib.bib38)]将学习参数与数据联系起来,并且最近的工作将这种分析跨越深度网络的各层[19 (https://arxiv.org/html/2608.11690#bib.bib41)]。这是我们的出发点,但回放改变了框架必须测量的对象,因此不能直接套用。相关量不再是参数–数据依赖性,而是缓冲区诱导的表示分布,而复用和不放回抽样产生的耦合是问题固有的而非干扰项:必须从一开始就纳入分析。使逐层处理不可避免的是两个渠道之间的不对称性。由于有限记忆渠道在每一层被重塑而耦合渠道则不然,黑箱式、假设级分析恰恰平均掉了缓冲区所诱导的深度结构,摧毁了我们本要解析的量——缓冲区有限样本偏差被其上网络放大最小的深度。因此,我们引入两个逐层对象:每任务回放质心,使有限记忆差异在每一深度都被良好定义;以及一个解耦参考,用于隔离由复用引起的依赖性。这些共同使有限记忆偏差和优化耦合能够放在一个分解中——而假设级信息论界无法表达这一点。

严缜地实现这一点有两个困难。第一是循环性:给定深度的特征图是在线学习的,并随进入缓冲区的样本而变化,因此我们用来测量回放差异的特征图恰是由我们正在测量的缓冲区塑造的。第二是累积:进入新任务的依赖性不是新产生的,而是从早期任务继承并沿训练轨迹累积的。两者必须联合处理,并且在任意深度处理,而不仅仅在输入或输出层。这正是本文三个构造所提供的:一个回放质心,使有限记忆差异在每一层都良好定义,并将其与依赖项分离;对这种差异的Wasserstein松弛,用于其信息论形式在支持不匹配下不适定的情况;以及一个轨迹级分解,对于具体的噪声优化器,将累积的依赖性分解为逐步贡献。

在高层次上,我们的分析将回放泛化分离为两个耦合效应:回放引起的漂移项(来自过去任务分布的有限记忆近似)和优化依赖项(来自通过共享下游参数对回放样本的复用)。前者量化表示空间中回放缓冲区与相应过去任务总体之间的不匹配,后者则捕捉学习的后缀参数在多大程度上编码了旧和当前任务表示的信息。这种分解清晰地区分了记忆压缩的统计成本与反复优化所产生的依赖性。然后,当基于KL的形式在支持不匹配下失效时,我们用Wasserstein松弛进一步细化漂移分支,并为随机梯度Langevin动力学(SGLD)实例化依赖分支。所得量旨在作为基于回放训练的解析诊断和控制信号,而不是替代现有的持续学习算法。

总之,我们的贡献如下:
- •我们为基于回放的持续学习开发了一个逐层信息论界,明确区分回放引起的漂移与优化依赖。该界进一步阐明了旧任务依赖、当前任务依赖、它们的交互以及残差耦合如何共同塑造期望泛化差距。
- •当基于KL的漂移项在经验–总体支持不匹配下失效时,我们推导出一个Wasserstein松弛,产生深度相关的漂移–敏感性权衡,并识别出一个内部泛化漏斗层,指示应稳定哪一层。
- •我们使用SGLD实例化优化依赖分支,并获得轨迹级对数行列式预算。这产生了敏感性感知的梯度对齐诊断和局部回放–当前混合规则。
- •我们通过受控和基准实验验证该理论,确认了预测的有限记忆缩放、漏斗行为以及回放动态中的对齐模式。

## II相关工作
### II-A基于回放的持续学习
顺序训练下的灾难性遗忘长期以来一直被认为是神经网络的核心障碍[29 (https://arxiv.org/html/2608.11690#bib.bib22),13 (https://arxiv.org/html/2608.11690#bib.bib23)],现代CL方法通常分为基于回放、基于正则化和基于架构/参数隔离的方法[46 (https://arxiv.org/html/2608.11690#bib.bib25),31 (https://arxiv.org/html/2608.11690#bib.bib1),48 (https://arxiv.org/html/2608.11690#bib.bib15)]。正则化方法通过参数重要性惩罚(如Fisher信息和突触重要性代理)约束更新[21 (https://arxiv.org/html/2608.11690#bib.bib12),51 (https://arxiv.org/html/2608.11690#bib.bib26),1 (https://arxiv.org/html/2608.11690#bib.bib27)],而架构策略跨任务扩展或划分参数[37 (https://arxiv.org/html/2608.11690#bib.bib28),28 (https://arxiv.org/html/2608.11690#bib.bib29)]。回放仍然是强大且有竞争力的选项,因为它通过重新访问存储样本直接对抗遗忘,例如样本排演[33 (https://arxiv.org/html/2608.11690#bib.bib14)]、通用经验回放[36 (https://arxiv.org/html/2608.11690#bib.bib13)]和生成回放[41 (https://arxiv.org/html/2608.11690#bib.bib35)]。现代回放系统主要区别在于如何分配内存和选择样本:典型选择是水库采样[7 (https://arxiv.org/html/2608.11690#bib.bib30)],而更有信息量的策略优先选择能最大化未来效用或减少干扰的样本[45 (https://arxiv.org/html/2608.11690#bib.bib36)],进一步的工作纠正了在线CL中侵蚀回放的表示漂移和类别不平衡[4 (https://arxiv.org/html/2608.11690#bib.bib37)]。回放还与显式控制梯度干扰的约束优化观点相关[2 (https://arxiv.org/html/2608.11690#bib.bib31)],包括GEM[27 (https://arxiv.org/html/2608.11690#bib.bib32)]、其平均变体A-GEM[5 (https://arxiv.org/html/2608.11690#bib.bib33)]和正交投影[38 (https://arxiv.org/html/2608.11690#bib.bib34)]。这些方法与本文观点一致,即回放将过去总体替换为有限代理分布,而演化的表示导致缓冲区在特征空间中移动。我们的目标不同于任何单一更新规则:我们从回放泛化的逐层分解出发,该分解区分分布漂移和优化耦合,并解释回放何时作为稳定的排演机制,何时成为对过去的偏差或强耦合代理。

### II-B信息论分析
最近的理论工作通过统计或优化视角研究顺序学习中的遗忘、任务顺序和泛化。与我们最接近的是关于遗忘的信息论和统计分析[25 (https://arxiv.org/html/2608.11690#bib.bib16),9 (https://arxiv.org/html/2608.11690#bib.bib17)],它们在线性或过参数化机制中运作,刻画任务相似性和顺序如何影响泛化。特别是在回放设置中,信息论界已经从假设与记忆缓冲区之间的依赖性推导出来[49 (https://arxiv.org/html/2608.11690#bib.bib4)],将理想全数据风险与记忆压缩成本分离。由于这些界在整体假设层面读取,其有限记忆项仍然是原始样本压缩成本,无法解析表示级漂移或差距出现的深度。我们的贡献在种类上不同:我们保留学习到的分层表示,并暴露假设级或输入层分析无法看到的逐层量(\(K(l)\mathcal{K}^{(l)},S(l),P(l),R(l)\mathcal{S}^{(l)},\mathcal{P}^{(l)},\mathcal{R}^{(l)}\))。我们不声称有更紧的常数;我们声称有更细粒度的分解。更广泛地说,信息论框架通过互信息[50 (https://arxiv.org/html/2608.11690#bib.bib18)]及其条件改进形式[44 (https://arxiv.org/html/2608.11690#bib.bib19),17 (https://arxiv.org/html/2608.11690#bib.bib38)]将学习参数与数据联系起来,并已被专门用于噪声迭代算法(如SGLD[30 (https://arxiv.org/h

相似文章

持续学习的学习动力学:数据归因、遗忘与可塑性损失的统一视角

Hugging Face Daily Papers

本文推导出学习一个 token 如何改变另一项预测的、统一的 token 级与层级分解,将数据归因、灾难性遗忘和可塑性损失统一为同一随时间演化更新-行为交互的不同形态。该分解给出了可前向计算的近似方法,从而支持跨模型与跨训练策略的数据选择、干扰控制以及对未来可学习性的诊断。

重新思考持续学习中的迁移:一种基于回放的实现方式

arXiv cs.LG

本文介绍了一个框架,用于判断在持续学习中何时应该期待迁移,并提出了选择性回放迁移(TSR),该机制选择预计对当前任务有益的回放数据,而非不加区分地回放过去的示例。TSR在保持稳定性的同时改善了前向迁移,优于现有的回放基线。

持续学习何时需要学习

arXiv cs.LG

本文提出了一个统一的LLM持续学习框架,将变化沿空间(新领域)和时间(数据漂移)两个维度进行解耦。它评估了多种方法,包括提示、监督学习、强化学习和上下文压缩,在现实的顺序设置下。