自蒸馏实现持续学习 [pdf]
摘要
介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。
暂无内容
查看缓存全文
缓存时间: 2026/05/17 03:44
# 自蒸馏实现持续学习
来源: https://arxiv.org/html/2601.19897
Idan Shenfeld¹², Mehul Damani¹, Jonas Hübotter³, Pulkit Agrawal¹²
¹MIT, ²Improbable AI Lab, ³ETH Zurich
###### 摘要
持续学习——使模型能在不降低现有能力的情况下获取新技能和知识——仍是基础模型面临的根本挑战。虽然在线策略强化学习可以减少遗忘,但它需要明确的奖励函数,而这通常难以获得。从专家演示中学习是主要的替代方案,主要通过监督微调(SFT)实现,而SFT本质上是离策略的。我们提出**自蒸馏微调(SDFT)**,一种简单的方法,可直接从演示中进行在线策略学习。SDFT利用情境学习,将演示条件模型作为自己的教师,生成在线策略训练信号,在获取新技能的同时保留先前能力。在技能学习和知识获取任务中,SDFT始终优于SFT,在实现更高新任务准确率的同时大幅减少灾难性遗忘。在序列学习实验中,SDFT使单个模型能够随时间积累多种技能而性能不退化,确立了在线策略蒸馏作为从演示中实现持续学习的实用路径。代码和数据集可在 http://idanshenfeld.com/SDFT 获取。
## 1 引言
图1说明:监督微调(SFT)常用于从专家演示数据集中学习,但其离策略特性导致通用能力的灾难性遗忘。我们提出自蒸馏微调(SDFT),通过使用模型的演示条件版本作为其自身的教师,将专家演示转化为在线策略学习信号。这样,SDFT实现了真正的持续学习,模型在新任务出现时不断改进,而不会退化现有能力。
基础模型近年来取得了显著成功,推动了语言、视觉、机器人等领域的AI应用。然而,尽管能力惊人,当今的AI系统在部署后仍是静态的。虽然它们可以通过检索或提示等方式在推理时调整行为,但不会更新参数来获取新技能、内化新知识或从经验中改进。为了推动下一代基础模型,我们必须解决持续学习问题:使AI系统能够随时间不断学习和改进,就像人类一生中积累知识和完善技能一样(Hassabis et al., 2017; De Lange et al., 2021)。
最近越来越多的工作强调了在线策略学习对于持续学习的重要性。当模型从当前策略生成的数据中学习时,与离策略方法相比,它们的灾难性遗忘显著减少(Shenfeld et al., 2025; Chen et al., 2025)。迄今为止,大多数成功的在线策略方法都是在强化学习(RL)背景下开发的,其中通过明确的奖励函数提供反馈。然而,在许多现实场景中,这种奖励无法获得或难以指定。相反,学习通常从专家演示数据集进行。在这种范式下的主流方法是监督微调(SFT),它在固定的离线数据分布下训练模型模仿专家动作。虽然简单且可扩展,但SFT本质上是离策略的,并且先前工作表明,当模型适应新任务或领域时,顺序SFT会导致泛化能力差和严重的灾难性遗忘(Kirkpatrick et al., 2017; Li & Hoiem, 2017)。这种矛盾给持续学习带来了根本性挑战:*当只有演示可用时,我们如何获得在线策略学习的好处?*
图2说明:(左)SDFT利用模型的情境学习能力生成在线策略训练信号。对于每个查询 \(x\),模型扮演两个角色:仅以查询为条件的学生 \(P = \pi(\cdot|x)\),以及以专家演示 \(c\) 为条件的教师 \(Q = \pi(\cdot|x, c)\)。训练最小化学生和教师之间的反向KL散度,产生在线策略更新。(右)以专家演示为条件为模型创建一个教师,其输出分布与基模型更接近,同时保持相同的新任务准确率。
离策略学习的挑战原则上可以通过先从演示中学习奖励函数(即逆强化学习IRL),然后进行在线策略RL来克服(Ng et al., 2000; Abbeel & Ng, 2004)。虽然IRL概念上优雅,但有效恢复奖励通常需要对奖励结构有很强的先验假设,这限制了它的实际应用,通常只在假设成立的环境下使用,如RLHF(Peng et al., 2018; Stiennon et al., 2020)。我们不是推断显式的奖励函数,而是提出自蒸馏微调(SDFT),一种直接从演示中学习的在线策略蒸馏(Ross et al., 2011; Agarwal et al., 2024)框架。SDFT依赖于如下观察:大型预训练模型表现出强大的情境学习能力——在条件于示例时无需参数更新即可调整其行为(Brown et al., 2020)。我们利用这一特性,让同一个模型扮演两个角色:教师,条件于任务输入和专家演示;学生,仅条件于任务输入。训练在学生自身生成的轨迹上,将教师的预测蒸馏给学生,产生在线策略更新,这些更新从演示中融入信息,而无需显式奖励推理或离线模仿。
我们在两个持续学习设置中评估SDFT:*技能学习*,其中演示用于改进任务表现;以及*知识获取*,其中新信息必须融入模型。在这两种设置中,SDFT提供稳定的在线策略更新,使得学习成为可能,同时与监督学习相比大幅减少灾难性遗忘。与先前关于在线策略学习的工作一致(Ross et al., 2011; Chu et al., 2025),SDFT还改进了分布内和分布外的泛化能力,即使在保留先前能力不是主要目标的设置中也同样有益。在一个涉及三种不同技能的序列学习实验中,SDFT使单个模型能够依次获取每种技能,同时保持先前学到的技能以及不相关的已有能力的性能——证明了从演示中进行持续学习是可行的。
## 2 相关工作
#### 离策略 vs 在线策略学习。
一系列工作强调了在线策略学习(即在模型自身诱导的轨迹上训练)相对于离策略学习的优势。Ross et al. (2011) 的开创性结果表明,离策略模仿学习在推理时遭受复合误差,因为所学策略偏离演示覆盖的状态,误差迅速累积;而在线策略算法通过持续在其自身状态分布下训练来避免这种失效模式。最近的实证研究进一步强化了这一区别。使用在线策略RL微调的模型在训练分布之外表现出更好的泛化能力(Agarwal et al., 2024; Han et al., 2025; Chu et al., 2025; Li et al., 2025),并且能更有效地迁移到相关任务(Huan et al., 2025)。在持续学习环境中,适应新任务时在线策略更新也减少了灾难性遗忘(Shenfeld et al., 2025; Lai et al., 2025)。这些发现共同激励我们的目标——从演示中实现在线策略学习,从而保留在线策略RL的优点,同时避免显式奖励工程的需求。
#### 逆强化学习。
逆强化学习(IRL)(Ng et al., 2000)为很多RL场景中面临的问题提供了经典解决方案:当没有显式奖励函数而只有演示时,智能体必须学习策略。与克隆专家动作不同,IRL试图推断使这些演示成为最优的潜在奖励。这种视角避免了离策略模仿学习的问题,因为推断出的奖励可以支持在线策略更新(Xu et al., 2020)。虽然这一想法具有深厚的理论吸引力,但传统IRL方法已知扩展性差(Lazzati et al., 2024; Arora & Doshi, 2021)。所有成功的IRL公式的共同点是依赖于强大的结构假设使奖励可识别。最大熵IRL假设专家遵循软最优玻尔兹曼策略(Ziebart et al., 2008; Wulfmeier et al., 2015);对抗性IRL方法(Ho & Ermon, 2016)假设专家和学习者轨迹可由分类器区分;基于偏好的IRL方法(如RLHF)(Ziegler et al., 2019; Ouyang et al., 2022)假设可以访问正负演示对。这些先验至关重要——没有它们,IRL要么不适定,要么成本过高不实用。在我们的方法中,我们没有施加显式的学习奖励函数,而是利用模型的情境学习来提取在线策略学习信号。
#### 情境蒸馏。
我们的方法也与日益增长的关于情境蒸馏的工作相关,其中以额外信息为条件的模型充当没有该信息的模型版本的教师(Bai et al., 2022; Snell et al., 2022)。先前的方法通常依赖于静态上下文(如少样本示例或行为指南)的离线蒸馏,并在从教师分布中抽取的轨迹上监督学生。我们的算法在两个重要方面有所不同。首先,蒸馏是在线策略的:学生在其自身诱导的轨迹分布下训练,允许教师纠正出现的错误(Ross et al., 2011; Agarwal et al., 2024)。其次,提供给教师的上下文不是固定的提示前缀,而是为每个查询选择的**特定**演示。这种动态的、实例级条件使教师能够表达细粒度的任务意图,而不是单一的全局行为先验。这些差异共同使得情境蒸馏不仅作为一种提示压缩形式,而是作为一种类似IRL的机制,提取并转移演示所诱导的底层推理。
## 3 自蒸馏微调
我们的方法建立在师生蒸馏框架之上,其中学生模型通过最小化其输出分布与教师之间的散度来匹配教师模型的行为。传统上,蒸馏使用不同的模型,通常是更大、更强大的教师和更小的学生(Hinton et al., 2015)。我们的关键创新在于,我们可以利用模型的**情境学习**能力,将**相同**模型同时用作教师和学生。具体来说,给定基础模型策略 \(\pi\),我们通过以专家演示为条件来构造教师:\(\pi(\cdot|x, c)\),其中 \(x\) 是任务提示,\(c\) 是演示。学生则是不加此条件的基模型 \(\pi_\theta(\cdot|x)\)。为了为给定的提示 \(x\) 构造教师,我们使用以下简单的提示将模型条件于提示和演示:
"这是一个回答问题的例子:[演示]。现在请回答你自己的回答,包括思考过程:"
我们发现这一提示足以防止策略逐字输出 \(c\),而是引出反映模型对演示背后意图的理解的回答,利用其情境学习能力。关于条件策略输出的进一步分析见3.2节。
如前所述,我们假设在线策略学习对于持续学习是必要的;因此,我们使用来自教师的在线策略蒸馏来训练学生。对于每个提示 \(x\),我们的算法SDFT从学生策略 \(y \sim \pi_\theta(\cdot|x)\) 采样响应,并最小化学生和教师分布之间的反向KL散度:
\[
\mathcal{L}(\theta) = D_{KL}\left(\pi_\theta(\cdot|x) \parallel \pi(\cdot|x,c)\right) = \mathbb{E}_{y \sim \pi_\theta(y|x)}\left[\log\frac{\pi_\theta(y|x)}{\pi(y|x,c)}\right] \tag{1}
\]
利用模型的自回归特性,我们将此目标分解为词元级损失(推导见Tang & Munos (2025)),并在固定教师分布的情况下对学生参数 \(\theta\) 求梯度。这产生以下梯度估计器(公式推导原文应保留,此处省略具体公式以避免过长不自然,但需要保留数学符号)...相似文章
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
自蒸馏作为大语言模型的性能恢复机制:对抗压缩和灾难性遗忘
本文介绍了自蒸馏微调(SDFT)作为大语言模型性能恢复机制,用于解决灾难性遗忘、量化和剪枝导致的性能下降问题。作者利用中心核对齐(CKA)提供了理论证明,表明自蒸馏能够使学生模型的高维流形与教师模型的最优结构对齐,从而有效恢复丧失的能力。
更密集并非更好:在线策略自蒸馏在持续后训练中的局限性
本文研究了持续后训练中的在线策略自蒸馏,发现它能加速领域内特化,但无法防止遗忘,并且在分布外场景中可能崩溃,这表明仅靠在线策略数据不足以实现持续学习。
向自我未来学习:面向扩散大语言模型的自策略知识蒸馏
介绍了 d-OPSD,这是首个面向扩散大语言模型的自策略知识蒸馏框架,采用后缀条件和步骤级别监督,在推理基准上优于 RLVR 和 SFT 基线。
自蒸馏策略梯度
本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。