重新思考持续学习中的迁移:一种基于回放的实现方式
摘要
本文介绍了一个框架,用于判断在持续学习中何时应该期待迁移,并提出了选择性回放迁移(TSR),该机制选择预计对当前任务有益的回放数据,而非不加区分地回放过去的示例。TSR在保持稳定性的同时改善了前向迁移,优于现有的回放基线。
arXiv:2607.15587v1 公告类型:新
摘要:持续学习研究的是已部署的语言模型如何在不进行昂贵的从头训练的情况下持续获取新任务。现有方法,无论是基于排练(回放存储的过去数据)还是无排练(正则化或隔离参数),绝大多数都针对一个目标:防止灾难性遗忘。与此同时,前向迁移(过去帮助未来)几乎完全通过参数重用来实现,根本没有明确说明何时应该期待迁移。我们提前一步:在设计迁移机制之前,我们问迁移究竟应该在何时存在。我们用一个包含三个可测量条件的框架来回答:目标任务必须在其有限的监督之外留有改进空间,可迁移的信息必须在持续优化中存活,并且回放必须来自兼容的先前任务。我们将这一观点实例化为选择性回放迁移(TSR),它选择预计对当前任务有益的回放数据,而不是不加区分地回放过去的示例。选择由零训练任务签名指导,而蒸馏则保持先前任务的稳定性。在低预算机制的标准持续学习协议下,TSR在保持稳定性的同时持续改善前向迁移,在异构和同构任务流中均优于现有的回放基线。更广泛地说,结果主张将迁移视为持续学习的一等目标,在工程实现之前先加以理解。
查看缓存全文
缓存时间: 2026/07/20 09:29
# 重新思考持续学习中的迁移:一种基于回放的实现 来源:https://arxiv.org/html/2607.15587 杨萌,刘振亚,赵卓凯†,陈宇欣† 芝加哥大学计算机科学系 [email protected] †共同通讯作者 ###### 摘要 持续学习研究如何使已部署的语言模型持续获取新任务,而无需从头进行昂贵的重新训练。现有方法,无论是基于回放(重放存储的历史数据)还是无回放(正则化或隔离参数),绝大部分都只针对一个目标:防止灾难性遗忘。而前向迁移——过去帮助未来——几乎仅通过参数复用来实现,对于迁移何时应该发生则缺乏明确的解释。我们提前一步:在设计迁移机制之前,先问迁移何时应该存在。我们用一个包含三个可测量条件的框架来回答:目标任务必须在其自身有限的监督之外留有改进空间,可迁移的信息必须在持续优化中存活,并且回放必须来自兼容的先前任务。我们将这一观点实例化为迁移选择性回放(TSR),该方法选择被预测对当前任务有益的回放数据,而不是不加区分地重放过去的样本。选择由一个零训练成本的任务签名引导,而蒸馏则保持对先前任务的稳定性。在标准持续学习协议的低预算设置下,TSR持续提升前向迁移的同时保持稳定性,在异构和同构任务流上均优于现有回放基线。更广泛地,结果表明应将迁移视为持续学习的一等目标,在工程实现之前先理解它。 ††脚注:代码可在 https://github.com/ymeng3/transfer-selective-replay 获取。 ## 1 引言 大型语言模型以巨大成本训练一次,然后部署到一个不断变化的世界:新领域、新格式和新技能在发布后不断出现(Wang et al., 2023b; 2024; Tankala et al., 2025; Asawa et al., 2026)。每次新增都从头重新训练是不可行的,因此已部署的模型必须*顺序地*学习任务——即持续学习的设置(De Lange et al., 2021; Ke and Liu, 2022; Momeni et al., 2025; Chen et al., 2026)。其定义性的失败模式几十年来广为人知:*灾难性遗忘*,即优化新任务会覆盖先前任务建立的内容(Kirkpatrick et al., 2017; Lopez-Paz and Ranzato, 2017; Zheng et al., 2025)。该领域将由此产生的张力描述为*稳定性-可塑性*权衡:稳定性保护过去,可塑性让模型继续学习,而单纯改善一方会损失另一方(De Lange et al., 2021; Momeni and Liu, 2025)。 当前的持续学习方法大致分为两类。*基于回放*的方法保留一个小缓存区的过去样本,并在新任务训练中使用——直接回放(Chaudhry et al., 2019b; Rebuffi et al., 2017)、通过logit锚定(Buzzega et al., 2020)、为保留而选择(Aljundi et al., 2019a; b)、或作为梯度约束(Chaudhry et al., 2019a)。*无回放*的方法不保留数据:它们对参数进行正则化以接近过去解(Kirkpatrick et al., 2017; Li and Hoiem, 2017),或将任务隔离在独立的参数子集中——在LLM时代这通常意味着独立的LoRA适配器(Hu et al., 2021)、保持正交(Wang et al., 2023a)、门控(Liang et al., 2025)、或分层组织(Qian et al., 2025)。两类方法在机制上不同,但目标一致:都回答稳定性问题,*如何防止过去被遗忘?* | 持续学习 | 迁移"让过去帮助新任务" | 稳定性"保护过去" | |---------|----------------------|------------------| | 在哪里可能? | 审计提升空间 | | | 什么承载它? | 持久的载体 | | | 依赖谁? | 路由到正确来源 | | | 回放 | 常规角色:保护旧任务(§2) | | | 蒸馏(KD) | 稳定性项 | | | 参数复用 | 广泛探索(§2) | | | 数据 | 本工作:选择*哪些过去*数据 | 本工作:将回放也指向*新*任务 | | 迁移选择性回放(一种实例化) | 审计的提升空间 · 选择的回放 · 用于稳定性的蒸馏 | | 图1:持续迁移的框架,以及一种实例化。 持续学习服务于两个目标。在迁移方面,我们将设计空间围绕三个问题组织——迁移在哪里可能(提升空间)、什么承载它(参数 vs. 数据)、以及依赖谁(来源选择);先前的迁移机制占据参数分支(§2),而本工作走数据分支,将迁移转化为数据选择问题。在稳定性方面,回放的常规角色是保护旧任务;我们将同一机制也指向*新*任务(虚线箭头),并将稳定性项分配给蒸馏(§5.3)。迁移选择性回放实例化了所有三个答案(§5)。 互补的问题——过去的任务是否能帮助学习未来的任务——受到的关注要少得多。*前向迁移*,即由于从先前任务获得的知识而改善新任务的学习,是持续学习承诺的好处;自GEM(Lopez-Paz and Ranzato, 2017)以来它被衡量,自Progressive Networks(Rusu et al., 2016)以来它被设计。然而在现代LLM基准上,它经常被报告为不存在或为负。现有促进前向迁移的尝试几乎完全依赖于*参数复用*:侧向连接和模块复用(Rusu et al., 2016; Veniat et al., 2021)、任务掩码和共享适配器(Ke et al., 2020; 2021a)、提示复用(Qin and Joty, 2022),以及对于LLM,路由、初始化或合并过去的适配器(Huang et al., 2023; Ilharco et al., 2023; Qian et al., 2025)。这条线背后的假设如此一致以至于很少被表述:*过去的知识存在于过去的参数中*。与此同时,过去任务的*数据*几乎只用于防止遗忘,而不是改善新任务的学习。回放被开发用于保持旧任务性能,而前向迁移依赖参数复用;两个方向基本上保持分离。尽管负迁移越来越多地被记录(Choi and Kim, 2026; Chen et al., 2026),该领域还没有对*何时*应该期望迁移的明确表述。 本文提前一步:*在设计迁移机制之前,我们先问什么使迁移成为可能。*我们在*低预算*持续学习中研究这个问题——每个任务带有固定的小训练样本(Zhao et al., 2024)。这是前向迁移在操作上有价值的持续学习场景:如果目标数据充足,任务自身就会饱和,无需过去提供什么(§4.1)。在固定预算下,迁移的价值不是取代目标监督,而是通过利用先前获得的经验来提高该预算可获得的性能。我们确定了决定迁移是否可能的三个可测量条件(§4): - **迁移可能发生在哪里?**只在目标任务在其有限的自身监督之外留有提升空间的地方——这是一个在引入任何迁移机制之前就可审计的属性(§4.1)。 - **什么承载迁移?**只有持久的载体。回放数据在整个训练过程中反复强化相同的优化方向,而一次性参数复用会逐渐被冲刷掉(§4.2)。 - **新任务应该依赖谁?**源质量差异显著,但兼容的源可以在零训练成本下使用标签感知的*任务签名*来识别(§4.3)。 我们围绕这三个问题组织持续迁移的设计空间(图1)。迁移选择性回放(TSR)是该框架的一种*实例化*。选择回放数据作为载体将前向迁移转化为*数据选择*问题:核心问题不再是是否回放,而是对于当前任务应回放哪些过去的经验。具体地,TSR维护一个任务记忆,每个过去任务有一条记录——任务签名、一个小数据子样本、以及该任务结束时的适配器快照。当新任务到达时,在固定共享初始化上进行几次前向-后向传递即可在零训练成本下产生其签名;然后,签名相似度的softmax将每个回放批次路由到与当前任务最对齐的过去数据,并且每个回放批次针对其自身时代的快照进行蒸馏。蒸馏通过保持稳定性来补充回放,让回放专注于迁移——我们后面的分析将其角色识别为优化正则化而非知识保留(§5.3)。 我们在标准持续学习协议下,在TRACE-8(Wang et al., 2023b)和NumGLUE-8(Mishra et al., 2022)上,跨越三个骨干家族(Qwen2.5, Gemma 3, Llama 3.2)和十三种涵盖基于回放和无回放的最新持续学习方法,对TSR进行评估。TSR通过提升前向迁移同时保持正的后向迁移,持续优于现有回放基线。 ##### 贡献 1. 1. **持续迁移的框架**。三个问题——在哪里(提升空间)、什么(载体)、谁(来源)——每个都是可测量的:在机制设计之前进行基准提升空间审计(oracle上限),同一基准的载体解耦分析,以及持续学习LLM中首个成对数据迁移矩阵,包括其负单元(§4)。 2. 2. **重新定义回放角色的实例化**。该领域最可靠的稳定性工具同时服务于两个目标,但此前只被分配了一个角色:TSR将回放指向*当前*任务,通过零训练、标签感知的签名在任务记忆(签名、数据、快照记录)上进行路由。其选择达到了事后oracle上限,并且在标准协议下是最强的回放策略(§5–6)。 3. 3. **对持续LLM学习中蒸馏作用的澄清**。通过系统的教师审计——身份、内容、损失形状、时机、快照来源——我们表明蒸馏通过优化*锚定*而非可迁移的教师知识做出贡献:其教师作为锚点,而非知识来源。这将该领域的知识保留叙述与操作机制分离开,并促使将蒸馏专用于稳定性目标(§5.3,附录B.4)。 ## 2 相关工作与定位 ##### 前向迁移。 将迁移作为持续学习的显式目标并不新鲜:Lopez-Paz 和 Ranzato(2017)形式化了前向和后向迁移指标,而设计前向迁移可追溯到 Progressive Networks(Rusu et al., 2016)。GEM 的前向迁移是零样本量(测试在训练之前);本研究关注的训练时意义——早期任务改善当前任务的*学习*——是顺序学习承诺的好处,而作为中间任务训练(STILTs; Phang et al., 2018; Vu et al., 2020)在 CL 之外已被充分研究,但从未在持续流内实例化。因此,缺失的不是目标而是*表述*:在机制设计之前,对迁移何时应该存在以及如何测量的说明(§4)。 ##### 参数侧迁移。 为实现训练时迁移而提出的机制几乎全是参数侧的:模块复用(Veniat et al., 2021)、共享骨干上的掩码和适配器(CAT/B-CL/CTR; Ke et al., 2020; 2021b; 2021a)、元学习表示(Javed and White, 2019)、以及软提示复用(Qin and Joty, 2022)——这一框架被 Ke 和 Liu(2022)的 NLP-CL 综述明确列出,将所有迁移机制归类为架构性的。在LLM时代,同样的假设驱动着推理时组合(LoRAHub、任务算术、AdapterSoup; Huang et al., 2023; Ilharco et al., 2023; Chronopoulou et al., 2023)和持续训练约束:正交适配器(O-LoRA/N-LoRA; Wang et al., 2023a; Yang et al., 2025)、单适配器合并(Qiao and Mahdavi, 2025)。
相似文章
漂移与依赖:基于回放的持续学习的逐层信息论界
本文提出了一个针对基于回放的持续学习的逐层信息论框架,将泛化差距分解为回放引起的表示漂移项和优化依赖项,并通过Wasserstein松弛与SGLD实例化对其进行了细化。
基于注意力的经验回放框架:用于不可知时间序列预测模型的持续学习
本文提出了一种新颖的持续学习框架,用于时间序列预测,该框架利用注意力引导的经验回放,使模型能够适应新的数据分布,同时避免灾难性遗忘。该框架在标准基准和真实世界的水位数据上进行了评估。
探索无回放缓冲区的持续学习:使用动态任务相似性路由的发现 [P]
介绍 Coincidex,一个开源的持续学习框架,使用动态任务相似性路由来避免回放缓冲区,包含基准测试结果和识别出的失败模式。
回放重要内容:用于高效LLM强化遗忘的离策略回放方法
本文介绍ReRULE,一种用于LLM强化遗忘的离策略回放方法,在RWKU和MUSE等基准测试中提高了遗忘与保留效率。
Continual Reasoning Gym: 诊断与利用持续 RLVR 中的共享推理
论文介绍了持续推理健身房,用于诊断和改进具有可验证奖励的持续强化学习(RLVR),提出了持续提示重放(CPR)以利用共享推理结构,达到多任务级性能。