@dwarkesh_sp: 最近遇到了 @srush_nlp,他给我即兴讲解了一下定向在线自蒸馏的工作原理……

X AI KOLs Following 新闻

摘要

Dwarkesh Patel 分享了 Sasha Rush 对定向在线自蒸馏的解释,其中提示标记被插入到轨迹中,以降低特定模型错误的权重,而无需新的 rollout。

最近遇到了 @srush_nlp,他给我即兴讲解了一下定向在线自蒸馏的工作原理。 我问他能否用我的iPhone录下来。 基本思路是这样的:如果模型在rollout的某个点犯了错误(例如,调用了一个不存在的工具),我们希望抑制这个特定错误,但我们不想仅仅从最终奖励中学习,因为那是一个非常嘈杂的信号,分散在整个轨迹中。 因此,我们让另一个模型读取这个轨迹,并找出错误发生的位置。它只是在错误发生位置的上方插入一些提示标记。 现在,有了这些注入的提示标记后,让模型运行一次前向传播。你不需要重新生成一个新的rollout——也就是说不需要新的解码步骤。 提示会使模型对错误标记分配更低的概率。然后你训练原始模型来匹配这些新概率,从而教会它降低那个特定错误的权重。
查看原文
查看缓存全文

缓存时间: 2026/06/05 05:11

最近遇到了 @srush_nlp,他临时给我上了一堂课,专门讲解有针对性的在线自蒸馏(targeted on-policy self-distillation)是如何运作的。

我问能不能用我的 iPhone 录下来。

基本思路是这样的:如果模型在某个 rollout 环节出了错(比如调用了不存在的工具),我们希望惩罚这个具体的错误,而不是单纯学习最终的奖励信号,因为最终奖励信号要分布在整个轨迹上,噪声太大。

于是我们用另一个模型来读取这段轨迹,找出错误到底出在哪里。它会在错误发生位置的上方,简单插入一些提示 token。

接下来,带着这些插入的提示 token,让模型做一次前向传播。不需要重新生成新的 rollout —— 也就是不需要再做解码。

这些提示会使模型给错误 token 分配更低的概率。然后我们训练原始模型,让它去匹配这些新的概率,从而学会降低那个具体错误的权重。

相似文章

自蒸馏实现持续学习 [pdf]

Hacker News Top

介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。

@michalwols: Amazing talk on on policy self distillation on @yacinelearning 's channel

X AI KOLs Timeline

This talk introduces self-distillation methods (SDPO and SDFT) that use model-generated rollouts and rich environment feedback (e.g., compiler errors) to create dense token-level learning signals, achieving 6× faster convergence than GRPO and 11× shorter reasoning traces, while also enabling sequential skill learning without forgetting.

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。