更密集并非更好:在线策略自蒸馏在持续后训练中的局限性
摘要
本文研究了持续后训练中的在线策略自蒸馏,发现它能加速领域内特化,但无法防止遗忘,并且在分布外场景中可能崩溃,这表明仅靠在线策略数据不足以实现持续学习。
查看缓存全文
缓存时间: 2026/07/03 03:52
Paper page - Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training
来源:https://huggingface.co/papers/2607.01763
摘要
在持续后训练中,同策略自蒸馏虽能加速领域内特化,但无法避免遗忘,且在分布外场景下可能崩溃,这表明仅靠同策略数据不足以支持持续学习。
持续后训练(https://huggingface.co/papers?q=Continual%20post-training)使基础模型能够获取新知识同时保留现有能力。近期研究认为同策略学习(https://huggingface.co/papers?q=on-policy%20learning)可以缓解遗忘,其中同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)成为一种极具吸引力的方法。本文中,我们通过自蒸馏策略优化(https://huggingface.co/papers?q=self-distillation)策略优化(https://huggingface.co/papers?q=policy%20optimization)(SDPO)重新审视了这一乐观观点。实验表明,当教师信号稳定且对齐良好时,SDPO能加速领域内特化,但在分布外场景下难以泛化。在持续后训练(https://huggingface.co/papers?q=continual%20post-training)中,SDPO表现出更强的遗忘甚至崩溃,而同策略强化学习(https://huggingface.co/papers?q=reinforcement%20learning)方法如GRPO(https://huggingface.co/papers?q=GRPO)则更保守地适应,并更好地保留先前能力。进一步分析揭示,密集自蒸馏(https://huggingface.co/papers?q=self-distillation)会在参数空间(https://huggingface.co/papers?q=parameter%20space)和响应空间(https://huggingface.co/papers?q=response%20space)中引发更大漂移,并通过自我强化的师生循环放大高频格式伪影。这些发现表明,仅靠同策略数据不足以支持持续学习(https://huggingface.co/papers?q=continual%20learning)。当教师目标稳定且token级监督可靠时,密集自蒸馏(https://huggingface.co/papers?q=self-distillation)可加速特化,但不应将其视为持续后训练(https://huggingface.co/papers?q=continual%20post-training)的默认稳定器。我们的代码已开源:https://github.com/Moenupa/SDPO-CL。
查看arXiv页面(https://arxiv.org/abs/2607.01763)查看PDF(https://arxiv.org/pdf/2607.01763)项目页面(https://moenupa.github.io/SDPO-CL)GitHub0(https://github.com/Moenupa/SDPO-CL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01763)
引用本文的模型0
暂无模型引用本文
请在模型README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。
引用本文的数据集0
暂无数据集引用本文
请在数据集README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。
引用本文的Space0
暂无Space引用本文
请在Space README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。
包含本文的收藏夹3
相似文章
自蒸馏实现持续学习 [pdf]
介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。
Adaptive Supervised Anchoring for On-Policy Self-Distillation
This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。