@BhavinJawade:我正在调研探讨和解释在线策略蒸馏及其变体失败模式的论文。
摘要
BhavinJawade 调研了关于在线策略蒸馏及其变体失败模式的论文,列出了近期多篇 arXiv 论文,包括《The Many Faces of On-Policy Distillation》等。
查看缓存全文
缓存时间: 2026/07/21 01:35
我目前正在梳理探讨并解释on-policy蒸馏及其变体失败模式的论文。稍后将分享一篇完整的博文。
这是我重点关注的一些论文:
《The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes》
https://arxiv.org/abs/2605.11182
《TRD: Trajectory-Refined Distillation》
https://arxiv.org/abs/2606.08432
《Rethinking On-Policy Distillation of Large Language Models》
https://arxiv.org/abs/2604.13016
《Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation》
https://arxiv.org/abs/2607.10805
《Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes》
https://arxiv.org/abs/2603.25562
On-Policy蒸馏的多重面孔:陷阱、机制与修复
来源:https://arxiv.org/abs/2605.11182
查看PDF(https://arxiv.org/pdf/2605.11182)
摘要: On-policy蒸馏(OPD)和on-policy自蒸馏(OPSD)已成为大语言模型有潜力的后训练方法,可在从模型自身策略采样的轨迹上提供密集的token级监督。然而,关于其有效性的现有结果仍好坏参半:虽然OP(S)D在系统提示和知识内化方面显示出潜力,但近期研究也报告了不稳定和退化现象。本文中,我们对OPD和OPSD在何时有效、何时失效以及原因进行了全面的实证研究。我们发现,数学推理任务上的OPD对教师模型选择和损失函数形式高度敏感,而OPSD在我们测试的设置中因测试时缺少实例特有的特权信息(PI)而失效。相比之下,当PI代表共享的潜在规则(如系统提示或对齐偏好)时,OPSD是有效的。我们识别出三种失效机制:(1)因基于学生生成的前缀进行条件化而导致的教师与学生之间的分布不匹配;(2)由有偏的TopK反向KL梯度引起的优化不稳定性;以及(3)一种OPSD特有的限制:学生学到的是聚合了PI条件化教师策略的无PI策略,当PI具有实例特异性时这还不够。我们进一步展示,stop-gradient TopK目标、适应RLVR的教师以及经过SFT稳定化的学生可以缓解这些失效。
提交历史
来自:Siqi Zhu 查看邮箱
[v1] 2026年5月11日周一 19:44:59 UTC(7,604 KB)
[v2] 2026年5月24日周日 01:43:21 UTC(7,578 KB)
相似文章
@BhavinJawade: **在线策略蒸馏并非免费午餐** 在线策略蒸馏已成为默认做法…
Bhavin Jawade 讨论了在线策略蒸馏在大语言模型训练中的几种失败模式,包括早期错误变得无法纠正、更强的教师反而更差、基于特权信息的条件化无法迁移,以及密集监督导致的思维崩溃。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。
@zhaisf: 这是 @geoffreyhinton 提出的蒸馏方法的一些神奇结果,当我第一次看到它们时,真的让我震惊,而且……
本文讨论了模型蒸馏对训练分布的惊人鲁棒性,即使与目标分布的重叠很小,以及其对在线/离线策略蒸馏的影响。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。