@zhaisf: 这是 @geoffreyhinton 提出的蒸馏方法的一些神奇结果,当我第一次看到它们时,真的让我震惊,而且……
摘要
本文讨论了模型蒸馏对训练分布的惊人鲁棒性,即使与目标分布的重叠很小,以及其对在线/离线策略蒸馏的影响。
查看缓存全文
缓存时间: 2026/06/08 11:19
这是 @geoffreyhinton 蒸馏方法带来的一些神奇结果,我第一次看到时真的震惊了,老实说到今天我还没完全搞懂:https://ttic.edu/dl/dark14.pdf。简而言之:蒸馏在训练分布上具有令人难以置信的稳健性,即使训练分布与目标分布几乎没有重叠。这也为当下热门的在线与离线蒸馏话题提供了一个有趣的视角——特别解释了为什么尽管两者存在(巨大)差异,却都是可行的选择。— 来源:https://www.ttic.edu/dl/dark14.pdf
相似文章
@BhavinJawade: **在线策略蒸馏并非免费午餐** 在线策略蒸馏已成为默认做法…
Bhavin Jawade 讨论了在线策略蒸馏在大语言模型训练中的几种失败模式,包括早期错误变得无法纠正、更强的教师反而更差、基于特权信息的条件化无法迁移,以及密集监督导致的思维崩溃。
分布视角下的 SFT、RL 与 On-Policy Distillation(19 分钟阅读)
本文从分布视角分析语言模型的后训练方法,对比 SFT、RL 和 On-Policy Distillation 如何重塑模型分布,及其对灾难性遗忘等现象的影响。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
利用在线策略逆蒸馏实现弱到强泛化
论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。