@dwarkesh_sp: 最近遇到了 @srush_nlp,他给我即兴讲解了一下定向在线自蒸馏的工作原理……
摘要
Dwarkesh Patel 分享了 Sasha Rush 对定向在线自蒸馏的解释,其中提示标记被插入到轨迹中,以降低特定模型错误的权重,而无需新的 rollout。
查看缓存全文
缓存时间: 2026/06/05 05:11
最近遇到了 @srush_nlp,他临时给我上了一堂课,专门讲解有针对性的在线自蒸馏(targeted on-policy self-distillation)是如何运作的。
我问能不能用我的 iPhone 录下来。
基本思路是这样的:如果模型在某个 rollout 环节出了错(比如调用了不存在的工具),我们希望惩罚这个具体的错误,而不是单纯学习最终的奖励信号,因为最终奖励信号要分布在整个轨迹上,噪声太大。
于是我们用另一个模型来读取这段轨迹,找出错误到底出在哪里。它会在错误发生位置的上方,简单插入一些提示 token。
接下来,带着这些插入的提示 token,让模型做一次前向传播。不需要重新生成新的 rollout —— 也就是不需要再做解码。
这些提示会使模型给错误 token 分配更低的概率。然后我们训练原始模型,让它去匹配这些新的概率,从而学会降低那个具体错误的权重。
相似文章
Self-Teacher 应看到什么?在线自蒸馏的特权上下文设计
本文研究在线自蒸馏中的特权上下文设计,表明中间抽象层次可以比完整解决方案更好地提升模型性能,同时使用更少的提示标记。
自蒸馏实现持续学习 [pdf]
介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。
@michalwols: Amazing talk on on policy self distillation on @yacinelearning 's channel
This talk introduces self-distillation methods (SDPO and SDFT) that use model-generated rollouts and rich environment feedback (e.g., compiler errors) to create dense token-level learning signals, achieving 6× faster convergence than GRPO and 11× shorter reasoning traces, while also enabling sequential skill learning without forgetting.
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。