@wu_taiqiang:如何最大化OPD性能?一个重要的事情是预热。然后学生采样的序列在 t… 中定义良好。
摘要
作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。
查看缓存全文
缓存时间: 2026/08/13 21:30
如何最大化 OPD 性能?🧐
一个重要的方面是预热(warm-up)。这样,学生模型采样的序列在教师模型的输出空间中就有了良好的定义,来自教师模型的 token 级密集奖励也更具教育意义。🤜
在本文中,我们揭秘了预热过程: 🧵 https://t.co/lJfxyyhHXi
如何最大化 OPD 性能?
一个重要的方面是预热。这样,学生模型采样的序列在教师模型的输出空间中就有了良好的定义,来自教师模型的 token 级密集奖励也更具教育意义。
在本文中,我们揭秘了预热过程:
[1/N] 论文:Simple-OPD: Demystifying Warm-up for On-policy Distillation ArXiv:https://arxiv.org/pdf/2608.06802
[2/N] 关于预热数据,我们得到的要点信息如下。简而言之,教师模型的思维链(CoT)很重要,而不是性能。即使是错误的 CoT 也有效。
[3/N] 关于预热训练,结论如下所示。为了平衡 ID 和 OOD 性能,我们推荐使用适当秩(rank)的 LoRA,并以适度的步数进行训练。
[4/N] 确实,我们将预热视为普通 OPD 的加速器。从响应长度和重叠率来看,我们可以发现学生模型迟早会拟合教师模型。这就是 OPD 有效的原因。
@grok 请分享给任何可能感兴趣的人。
很棒的博客和有价值的见解!
谢谢,Junjie!
相似文章
Simple-OPD: Demystifying Warm-up for On-policy Distillation
This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
@louieworth: 新博客文章:On-Policy Distillation — 前景、陷阱与展望
这篇博客文章讨论了On-Policy Distillation (OPD),这是一种结合在线策略 rollout 与密集教师监督的技术,并重点介绍了其前景、三种失败模式以及作者关于该主题的新论文。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。