@louieworth: 新博客文章:On-Policy Distillation — 前景、陷阱与展望

X AI KOLs Following 论文

摘要

这篇博客文章讨论了On-Policy Distillation (OPD),这是一种结合在线策略 rollout 与密集教师监督的技术,并重点介绍了其前景、三种失败模式以及作者关于该主题的新论文。

新博客文章:On-Policy Distillation — 前景、陷阱与展望。 OPD 结合了在线策略 rollout 与密集教师监督。 但这并不是免费的午餐。 我讨论了三种失败模式,并介绍了我们的新论文。 https://t.co/xU35CqoMi3 https://t.co/24ElhIhgje
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:57

新博客文章:在线策略蒸馏——前景、陷阱与展望。

OPD 结合了在线策略轨迹生成与密集的教师监督。

但它并非免费午餐。

我将讨论三种失败模式,并介绍我们的新论文。

https://t.co/xU35CqoMi3 https://t.co/24ElhIhgje


李江 — 在线策略蒸馏:前景、陷阱与展望

来源:https://louieworth.github.io/blog/opd_reflection/ 在线策略蒸馏 (OPD) (Gu et al., 2023 (https://arxiv.org/abs/2306.08543); Agarwal et al., 2023 (https://arxiv.org/abs/2306.13649); Lu and Thinking Machines Lab, 2025 (https://thinkingmachines.ai/blog/on-policy-distillation/#on-policy-distillation–best-of-both-worlds)) 的前景源于它对两个基本要素的重新组织:生成轨迹的策略,以及附着在这些轨迹上的学习信号的密度。第一个轴是在线策略与离线策略,询问我们是在学生自身采样的轨迹上训练,还是在外部的教师或数据集上训练。第二个轴是稀疏监督与密集监督,询问模型接收的仅是结果级别的奖励,还是轨迹中每个词元级别的信号。监督微调 (SFT) 和带可验证奖励的强化学习 (RLVR) 位于此空间的相对两端。SFT 提供密集的学习信号,但通常是在离线策略轨迹上。RLVR 使用在线策略轨迹,但通常将整个推理过程简化为一个稀疏的可验证奖励。OPD 试图结合两者的有用部分:在线策略的学生轨迹与密集的教师反馈。

每个端点都有明显的优势和明显的局限性。SFT 信息丰富,因为目标轨迹中的每个词元都可以成为监督信号,这使其成为从专家转移知识的有效方法。然而,这种离线策略训练方案在扩展性能时可能资源密集。同样的不匹配也表现为模仿学习中常见的复合误差 (https://proceedings.mlr.press/v15/ross11a):在训练期间,模型在干净的专家前缀之后预测下一个词元;在部署期间,每个词元都以模型自身生成的前缀为条件。如果早期词元偏离了演示分布,后续词元将从偏移的上下文中采样,使轨迹进一步进入数据集几乎无法提供指导的区域。

根据轨迹来源和监督密度比较 SFT、RLVR 和 OPD 的双轴图 (https://louieworth.github.io/figs/sft-rlvr-opd-tradeoff.svg) SFT 在离线策略的专家轨迹上提供密集监督。RLVR 使用在线策略的学生轨迹,但通常只提供稀疏的结果信号。OPD 试图保留 RLVR 的在线策略部分,同时恢复蒸馏中的密集词元级监督。

RLVR 采取了与 SFT 相反的权衡。其主要优势在于轨迹是在线策略的,因此更新基于学生实际产生的行为。如果模型陷入不良的推理模式,RLVR 可以直接在该失败模式上进行训练,而不仅仅是展示另一个专家演示。局限性在于学习信号的稀疏性。验证器可能告诉学生某个轨迹成功或失败,但无论模型使用了多少个词元,这个反馈只携带少量信息。对于长的推理过程,模型可能知道最终答案是错的,却不知道错误发生在哪里;或者知道最终答案是对的,却不知道哪些步骤真正重要。这使得正负样本的信用分配都很弱。

OPD 之所以吸引人,是因为它试图保留 RLVR 的在线策略部分,同时恢复蒸馏中的密集监督。学生仍然生成轨迹,因此训练数据与学生实际访问的状态对齐。但 OPD 不是对整个轨迹分配单一奖励,而是让更强的教师沿着学生生成的轨迹提供词元级反馈,通常通过对数概率或 KL 散度形式的目标来实现。从这个意义上说,教师不再只是静态演示的来源。它成为学生自身前缀的批评者,告诉学生在学生实际需要指导的状态下,专家本会偏好什么。一个密切相关的变体是在线策略自蒸馏 (OPSD) (Zhao et al., 2026 (https://arxiv.org/abs/2601.18734))。这里教师通常是同一个学生模型,但带有一些额外信息,例如真实答案。为便于阅读,我在本文其余部分将 OPD 作为总称,除非区别重要,否则将 OPSD 视为一种变体。教师信号的来源不同,但许多动机、优势和失败模式是共享的。

陷阱

然而,这个故事并非完全乐观。最近的几项并行工作已经识别出 OPD 的失败模式。这些陷阱值得理解,因为它们明确了一点:在线策略蒸馏并非免费午餐。我将不单独介绍每个结果,而是围绕三个相连的失败机制来组织讨论:教师监督的局部噪声、由视野引起的监督衰减,以及来自教师的短视梯度。这些并非独立的盒子。第二个可以放大第一个,第三个源于 OPD 当前的训练范式:在学生轨迹之后进行博士后监督。

教师监督中的局部噪声

第一个陷阱是局部目标不匹配:OPD 要求教师在学生生成的前缀上提供词元级监督,但由此产生的教师分布并不总是可靠的训练目标。当学生生成的前缀稀疏或偏离教师的流形时,教师的下一词元分布可能混合多种不同的动作:将延续引导回教师通常的推理流形、局部延续学生的前缀、或采取一个看似合理但无帮助的步骤。误导性前缀使情况更糟,每个词元的监督信号可能崩溃,因为局部看似合理的延续可能强化错误的路径 (Fu et al., 2026 (https://arxiv.org/abs/2603.25562); Zhu et al., 2026 (https://arxiv.org/abs/2605.11182))。

显示局部目标不匹配的图表,其中教师反馈混合了恢复动作和对误导性学生前缀的延续 (https://louieworth.github.io/figs/local-target-mismatch.svg) 教师的局部分布可能混合恢复动作和对误导性路径的延续。密集信号仍然是局部的,但它不再是干净的恢复目标。

许多近期工作直接或间接地识别出这种局部噪声教师监督,并提出了恢复更可靠指导的方法。它们的修复通常围绕两类干预,有时单独,有时结合:修改 KL 散度风格的目标,以及重新加权或选择词元级信号。Fu 等人使用教师 top-K 局部支持匹配来将 KL 比较限制在更可靠的局部支持上 (Fu et al., 2026 (https://arxiv.org/abs/2603.25562))。TIP 使用学生熵和师生散度对词元重新加权,将更新聚焦在不确定位置和过度自信的错误上 (Xu et al., 2026 (https://arxiv.org/abs/2604.14084))。SCOPE 根据正确性对轨迹进行路由,对失败轨迹使用教师困惑度加权的 KL,对成功轨迹使用学生困惑度加权的 MLE (Zheng et al., 2026 (https://arxiv.org/abs/2604.10688))。熵感知 OPD 根据教师熵改变散度,在低熵区域结合反向 KL,在高熵区域结合前向 KL (Jin et al., 2026 (https://arxiv.org/abs/2603.07079))。OPSD 引入逐词元截断的 KL 以稳定训练 (Zhao et al., 2026 (https://arxiv.org/abs/2601.18734)),而 DASD 使监督方向具有熵自适应性以保留探索 (Zhang et al., 2026 (https://arxiv.org/abs/2605.22263))。共同的经验是:密集监督并非自动可靠的监督:OPD 需要某种方式来决定哪些局部信号值得信任,信任程度如何,以及学习的方向。

由视野引起的教师覆盖衰减

第二个陷阱是上述局部问题的视野级别版本。通过训练学生自身生成的轨迹,OPD 解决了 SFT 等离线策略蒸馏方法中出现的、在模仿学习文献中也很熟悉的、学生端的复合误差。然而,OPD 并未消除分布偏移;它将负担从学生转移到了教师。学生是在线策略的,但教师被要求监督从学生采样的前缀,而不是教师自然产生的前缀。在轨迹早期,这种区别可能很小。然而,经过几个学生决策后,前缀可能包含教师本不会遵循的不同分解、不同中间值或不同计划。即使每个偏差很小,偏差也会在前缀中累积。随着视野的增长,教师被越来越频繁地查询其通常前缀分布之外的状态。尽管教师监督仍然密集,但随着局部噪声在更长视野上累积,它可能变得不那么可靠,尤其是在需要长响应的任务中,例如 MATH 风格的推理任务。

显示教师覆盖在长 OPD 轨迹上衰减的图表 (https://louieworth.github.io/figs/teacher-coverage-decay.svg) 早期学生前缀可能仍在教师的常见前缀分布内。经过长的轨迹,学生轨迹可能逐渐漂移出该覆盖区域,因此反馈保持密集但变得不太可靠。

最近的修复大多试图防止长轨迹将密集监督变成密集但不可靠的监督。StableOPD 使用基于参考的散度约束和轨迹混合蒸馏来稳定训练 (Luo et al., 2026 (https://arxiv.org/abs/2604.08527))。Prune-OPD 通过监控学生-教师兼容性使可靠性测试更明确,减少不可靠轨迹后缀的影响,并根据近期样本中可靠词元的有效长度调整轨迹预算 (Yang et al., 2026 (https://arxiv.org/abs/2605.07804))。Liu et al., 2026 (https://arxiv.org/abs/2605.13643) 类似地检测何时后续轨迹段变得难以局部教学,并停止对这些不可靠后缀应用密集监督。将这一逻辑推向最直接的形式,Zhou et al., 2026 (https://arxiv.org/abs/2605.27028) 和 Zhang et al., 2026 (https://arxiv.org/abs/2605.31490) 甚至极端地限制轨迹预算本身(例如,响应词元=100),但性能依然可比。

完美的教师能否恢复修正路径?

到目前为止,我们讨论的主要 OPD 失败都源于教师监督的可靠性。这些担忧自然引出一个更尖锐的问题:如果我们移除可靠性问题,给 OPD 一个完美的教师,它能否引导学生沿着修正路径从一个误导性前缀恢复?遗憾的是,在当前的 OPD 范式下,答案仍然很可能是否定的。当前的逐词元 OPD 在结构上受限,因为它是一个在学生的轨迹上评估的事后逐词元目标。解释其原因的一个有用方式是检查实际 OPD 使用的梯度。如果我们从序列级别的反向 KL 目标开始,策略梯度形式给每个采样词元一个回报,该回报包括其自身的师生对数比以及沿着同一学生轨迹的未来对数比:

\nabla_\theta J(\theta) = \mathbb{E}_{x\sim \mathcal{D},\, y\sim \pi_\theta(\cdot \mid x)} \left[ \sum_{t=1}^{|y|} \left( \delta_t + \sum_{t'=t+1}^{|y|} \delta_{t'} \right) \nabla_\theta \log \pi_\theta(y_t \mid x, y_{<t}) \right], \tag{2}

其中 \delta_t = \log \pi_\theta(y_t \mid x, y_{<t}) - \log \pi_T(y_t \mid x, y_{<t});完整推导见 Yang et al., 2026 (https://arxiv.org/abs/2602.12125)。然而,在实践中,OPD 通常实现为逐词元的代理目标:

\nabla_\theta J(\theta) = \mathbb{E}_{x\sim \mathcal{D},\, y\sim \pi_\theta(\cdot \mid x)} \left[ \sum_{t=1}^{|y|} \delta_t \nabla_\theta \log \pi_\theta(y_t \mid x, y_{<t}) \right]. \tag{3}

这是相对于序列级目标的有偏梯度。在有界奖励和得分函数假设下,序列级估计器的最坏情况方差按 O(T^4) 缩放,而逐词元代理按 O(T^2) 缩放 (Fu et al., 2026 (https://arxiv.org/abs/2603.25562))。这稳定了长响应训练,但也引入了短视的教师监督,其中每个位置的局部教师不匹配被视为整个学习信号,而不是轨迹级回报的一部分。

这种短视梯度在学生到达误导性前缀且恢复需要多步修正路径时变得具有限制性。当教师看到这样的误导性前缀并试图恢复时,它可能会正确地为修正起始词元(如“Wait”或“Actually”)分配高概率。这些方法可以使第一个修正词元更可能被生成,但标准的 OPD 仍然将后续的损失条件于学生的原始失败延续,而不是该修正词元后会跟随的前缀。即使教师知道完整的恢复应该如何展开,梯度可能持续从多个误导性上下文中指向修正起始词元,而不监督多步修正路径本身。这一担忧也被 Prof. Omar Khattab 在 X (https://x.com/lateinteraction/status/2059736880514793537) 上非正式地提出。然而,短视信号并非无用;将学生偏向于修正起始词元仍然可以触发未来轨迹的自我反思,尽管展开完整修正路径仍受限于学生自身的能力。关于这种短视监督机制的更详细分析出现在我们的工作中 (Jiang et al., 2026 (https://arxiv.org/abs/2606.08432))。

显示短视逐词元 OPD 重复局部修正提示,而后续监督仍留在误导性学生轨迹上的图表 (https://louieworth.github.io/figs/myopic-supervision-gap.svg) 逐词元 OPD 可以强化局部修正提示,但这些提示仍然附着在误导性前缀上。多步恢复所需修正后的延续并未生成。

自然的反应可能是从词元级代理移回序列级梯度,但这不能解决根本问题,因为原始的 OPD 是事后监督。学生首先生成完整轨迹,然后沿着该固定轨迹计算教师监督。序列级损失可能为早期决策提供更强的修正信号,但它仍然没有让学生接触到恢复路径;后续监督仍然条件于原始的失败延续。同时,由于实践中教师并不完美,后续词元的局部监督信号中的噪声也可能反向传播到早期词元并累积,从而进一步降低早期词元的学习信号。

对于短视监督,先前的修复方法无效,因为它们没有干预到…

相似文章

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

基于同伴成功与失败的多 rollout 在策略蒸馏

arXiv cs.LG

提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。