更密集并非更好:在线策略自蒸馏在持续后训练中的局限性

Hugging Face Daily Papers 论文

摘要

本文研究了持续后训练中的在线策略自蒸馏,发现它能加速领域内特化,但无法防止遗忘,并且在分布外场景中可能崩溃,这表明仅靠在线策略数据不足以实现持续学习。

持续后训练使基础模型能够获取新知识同时保留现有能力。近期研究表明,在线策略学习可以缓解遗忘,其中在线策略自蒸馏成为一种特别有吸引力的方法。本文通过自蒸馏策略优化(Self-Distillation Policy Optimization, SDPO)重新审视了这一乐观观点。我们的实验表明,当教师信号稳定且良好对齐时,SDPO能加速领域内特化,但难以泛化到分布外场景。在持续后训练中,SDPO表现出更强的遗忘,甚至可能崩溃,而GRPO等在线策略强化学习方法则更保守地适应,更好地保留先前能力。进一步的分析表明,更密集的自蒸馏会导致参数空间和响应空间中的更大漂移,并可能通过自我强化的师生循环放大高频格式化伪影。这些发现表明,仅靠在线策略数据不足以实现持续学习。密集自蒸馏在教师目标稳定且词元级监督可靠时能加速特化,但不应将其视为持续后训练的默认稳定器。我们的代码可在 https://github.com/Moenupa/SDPO-CL 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

Paper page - Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

来源:https://huggingface.co/papers/2607.01763

摘要

在持续后训练中,同策略自蒸馏虽能加速领域内特化,但无法避免遗忘,且在分布外场景下可能崩溃,这表明仅靠同策略数据不足以支持持续学习。

持续后训练(https://huggingface.co/papers?q=Continual%20post-training)使基础模型能够获取新知识同时保留现有能力。近期研究认为同策略学习(https://huggingface.co/papers?q=on-policy%20learning)可以缓解遗忘,其中同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)成为一种极具吸引力的方法。本文中,我们通过自蒸馏策略优化(https://huggingface.co/papers?q=self-distillation)策略优化(https://huggingface.co/papers?q=policy%20optimization)(SDPO)重新审视了这一乐观观点。实验表明,当教师信号稳定且对齐良好时,SDPO能加速领域内特化,但在分布外场景下难以泛化。在持续后训练(https://huggingface.co/papers?q=continual%20post-training)中,SDPO表现出更强的遗忘甚至崩溃,而同策略强化学习(https://huggingface.co/papers?q=reinforcement%20learning)方法如GRPO(https://huggingface.co/papers?q=GRPO)则更保守地适应,并更好地保留先前能力。进一步分析揭示,密集自蒸馏(https://huggingface.co/papers?q=self-distillation)会在参数空间(https://huggingface.co/papers?q=parameter%20space)和响应空间(https://huggingface.co/papers?q=response%20space)中引发更大漂移,并通过自我强化的师生循环放大高频格式伪影。这些发现表明,仅靠同策略数据不足以支持持续学习(https://huggingface.co/papers?q=continual%20learning)。当教师目标稳定且token级监督可靠时,密集自蒸馏(https://huggingface.co/papers?q=self-distillation)可加速特化,但不应将其视为持续后训练(https://huggingface.co/papers?q=continual%20post-training)的默认稳定器。我们的代码已开源:https://github.com/Moenupa/SDPO-CL。

查看arXiv页面(https://arxiv.org/abs/2607.01763)查看PDF(https://arxiv.org/pdf/2607.01763)项目页面(https://moenupa.github.io/SDPO-CL)GitHub0(https://github.com/Moenupa/SDPO-CL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01763)

引用本文的模型0

暂无模型引用本文

请在模型README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。

引用本文的数据集0

暂无数据集引用本文

请在数据集README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。

引用本文的Space0

暂无Space引用本文

请在Space README.md中引用arxiv.org/abs/2607.01763,以便在此页面显示链接。

包含本文的收藏夹3

相似文章

自蒸馏实现持续学习 [pdf]

Hacker News Top

介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。

Adaptive Supervised Anchoring for On-Policy Self-Distillation

arXiv cs.LG

This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。