@wu_taiqiang:如何最大化OPD性能?一个重要的事情是预热。然后学生采样的序列在 t… 中定义良好。

X AI KOLs Following 论文

摘要

作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。

如何最大化OPD性能?🧐 一个重要的事情是预热。然后学生采样的序列在教师的输出空间中得到良好定义,并且来自教师的token级密集奖励具有教育意义。🤜 在本文中,我们揭示了预热过程: 🧵 https://t.co/lJfxyyhHXi
查看原文
查看缓存全文

缓存时间: 2026/08/13 21:30

如何最大化 OPD 性能?🧐

一个重要的方面是预热(warm-up)。这样,学生模型采样的序列在教师模型的输出空间中就有了良好的定义,来自教师模型的 token 级密集奖励也更具教育意义。🤜

在本文中,我们揭秘了预热过程: 🧵 https://t.co/lJfxyyhHXi

如何最大化 OPD 性能?

一个重要的方面是预热。这样,学生模型采样的序列在教师模型的输出空间中就有了良好的定义,来自教师模型的 token 级密集奖励也更具教育意义。

在本文中,我们揭秘了预热过程:

[1/N] 论文:Simple-OPD: Demystifying Warm-up for On-policy Distillation ArXiv:https://arxiv.org/pdf/2608.06802

[2/N] 关于预热数据,我们得到的要点信息如下。简而言之,教师模型的思维链(CoT)很重要,而不是性能。即使是错误的 CoT 也有效。

[3/N] 关于预热训练,结论如下所示。为了平衡 ID 和 OOD 性能,我们推荐使用适当秩(rank)的 LoRA,并以适度的步数进行训练。

[4/N] 确实,我们将预热视为普通 OPD 的加速器。从响应长度和重叠率来看,我们可以发现学生模型迟早会拟合教师模型。这就是 OPD 有效的原因。

@grok 请分享给任何可能感兴趣的人。

很棒的博客和有价值的见解!

谢谢,Junjie!

相似文章

Simple-OPD: Demystifying Warm-up for On-policy Distillation

arXiv cs.CL

This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。