@BhavinJawade: **在线策略蒸馏并非免费午餐** 在线策略蒸馏已成为默认做法…

X AI KOLs Timeline 新闻

摘要

Bhavin Jawade 讨论了在线策略蒸馏在大语言模型训练中的几种失败模式,包括早期错误变得无法纠正、更强的教师反而更差、基于特权信息的条件化无法迁移,以及密集监督导致的思维崩溃。

**在线策略蒸馏并非免费午餐** 在线策略蒸馏已成为许多开源前沿模型训练后处理的默认工具。近期发布的模型大量依赖它:DeepSeek v4、MiMO 和 Nemotron-Cascade-2 使用了 MOPD,GLM 5.x 使用了在线策略跨阶段自蒸馏。它利用强化学习的在线策略性质来减少曝光偏差,同时提供 SFT 那样的词元级监督。 但 OPD 和 OPSD 也有自己的失败模式。本文讨论其中几种: 1. **早期错误在结构上无法纠正**。当学生模型采样一条轨迹并过早地走错时,沿着那条冻结轨迹计算的逐词元 KL 无法将其拉回到正确路径上。TRD 证明,这种失败内嵌于目标函数中,而非噪声梯度问题。即使有完美教师,从学生自身轨迹上得到的词元级 KL 梯度,仅在学生首次偏离的那个词元处与理想修正梯度一致,之后的所有梯度方向都错误。因此,之后的每个监督目标都锚定于学生本不应进入的上下文。由于重加权或裁剪只重新缩放每个词元梯度的幅度,而这里的梯度项指向错误方向,没有任何逐词元调整能恢复正确的更新。TRD 提出的解决方法是沿着教师精炼的轨迹而不是原始学生轨迹进行蒸馏,从而恢复学生实际能遵循的目标。 2. **更强的教师反而更差**。在线策略蒸馏只能教给学生自己访问过的状态,而每个状态中可用的信号存在于学生和教师下一词元分布的重叠部分。Rethinking OPD 表明,一个更大、得分更高的教师可能无法让学生进步,而一个较弱的教师却能成功,因为如果教师的词元分布将质量放在学生很少产生的词元上,那么重叠区域很小,无论教师的绝对能力有多强,几乎没有任何知识转移。真正预测成功的是早期前 k 思维模式重叠。在成功的运行中,共享的前 k 词元承载了 97% 至 99% 的概率质量,并且重叠比例在训练中稳步上升;而一开始重叠低的运行永远无法恢复。采用与学生相同配方训练的教师也会收敛到学生的分布,因此其更高的基准分数并不对应它可以转移的任何新知识。实际规则是选择与学生分布接近的教师,而不是根据排行榜排名。 3. **基于特权信息条件化的 OPSD 可能无法转移**。在 OPSD 中,你将一个基于特权信息(如标准答案)条件化的教师蒸馏到永远不会拥有该信息的学生中。The Many Faces of OPD 展示了当这些信息是实例特定的时会出现的问题。学生无法恢复教师的逐实例推理,因为它从未见过答案,所以它反而学习了一个单一的、无答案的策略,实际上平均了教师在所有问题上的行为,而这个平均策略过于通用,无法解决任何一个具体问题。其标志是初始提升后迅速崩溃:轨迹变长,充满模棱两可的词元,准确率跌至零附近。只有当特权信息是适用于所有实例的共享规则(如系统提示或对齐偏好)时,这种方法才有效,而当它是每个问题特有的答案时则无效。 4. **思维崩溃:密集监督抑制模型的自身推理**。一个以答案为条件的教师没有理由犹豫、回溯或探索,因此其逐词元目标悄悄压制了学生的推理词元。Diagnosing and Mitigating Thinking Collapse 将这种现象称为思维崩溃:在训练过程中,学生自身的推理行为逐渐退化,因为承载它的探索性词元(如“等等”、“也许”、“或者”)变得越来越少。其机制是局部的而非全局的。损害集中在高熵决策分叉点,即学生确实不确定并通常会进行推理的节点。正是在这些地方,学生的 top-1 词元往往是探索标记,而答案条件化教师的 top-1 词元则不是,因此这种不匹配产生了强烈的梯度,压制了正是使推理得以进行的那些词元。结果是模型自身的推理行为被明显抑制,下游推理准确率也随之下降。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:29

On-policy蒸馏并非免费的午餐

On-policy蒸馏已成为许多开源前沿模型训练配方中默认的后训练工具。近期发布的模型大量依赖此技术:DeepSeek v4、MiMO和Nemotron-Cascade-2使用MOPD,GLM 5.x则采用on-policy跨阶段自蒸馏。它利用RL的on-policy特性减少暴露偏差,同时提供类似SFT的token级监督。 但OPD和OPSD有其自身的失败模式。本文讨论其中几点:

  1. 早期错误在结构上不可纠正。当学生模型采样一条轨迹并过早转向错误方向时,沿该冻结轨迹计算的逐token KL散度无法将其拉回正确路径。TRD证明这种失败内置于目标函数本身,而非梯度噪声问题。即使拥有完美教师模型,基于学生自身轨迹的token级KL梯度仅在分歧发生的第一个token处与理想校正梯度一致,此后所有后续token的梯度方向均相悖。因此每个后续的监督目标都锚定在学生本不该进入的上下文中。由于重加权或裁剪仅缩放每个token梯度的幅度,而当这些梯度方向错误时,任何逐token调整都无法恢复正确更新。TRD提出的修复方案是沿教师优化后的轨迹进行蒸馏,而非原始学生轨迹,从而恢复学生实际可遵循的目标。

  2. 更强的教师可能成为更差的教师。On-policy蒸馏只能在学生自身访问的状态上教学,而每个状态的可利用信号存在于学生与教师下一个token分布的重叠区域。《重新思考OPD》表明,更大、评分更高的教师可能无法推动学生进步,而较弱教师却能成功。这是因为若教师的token分布将其概率质量集中在学生极少生成的token上,则重叠区域极小,无论教师绝对能力多强,几乎没有任何知识迁移。真正预测成功的是早期top-k思维模式重叠度。在成功的训练中,共享的top-k token承载97-99%的概率质量,且重叠率在训练中稳步上升;而初始重叠度低的训练运行永远无法恢复。采用与学生相同配方训练的教师会收敛到学生自身的分布,因此其更高的基准分数并不对应任何可迁移的新知识。实践准则是根据与学生分布的接近程度选择教师,而非排行榜排名。

  3. 特权信息条件化OPSD可能迁移失败。在OPSD中,你将依赖特权信息(如标准答案)的教师蒸馏到永远无法获取该信息的学生中。《OPD的多重面相》揭示了当这些信息为实例特定时会出现的问题。学生无法恢复教师逐实例的推理过程(因永远看不到答案),因此它学习单一的与答案无关的策略,实质上平均化了教师在所有问题上的行为,而该平均策略过于泛化,无法解决任何特定问题。其标志是初始提升后迅速崩溃:生成轨迹变长、充斥模棱两可的token、准确率跌向零。该方法仅在特权信息为适用于所有实例的共享规则(如系统提示或对齐偏好)时有效,而不适用于每个问题的具体答案。

  4. 思维崩塌:密集监督压制模型自身的思考过程。依赖答案的教师没有理由犹豫、回溯或探索,因此其逐token目标会悄悄压制学生的思考token。《诊断与缓解思维崩塌》将这一现象命名为思维崩塌:随着训练进行,学生原生推理行为逐渐退化,承载推理过程的探索性token(如“wait“、“maybe”、“alternatively”)频率持续降低。该机制具有局部性而非全局性。损害集中在高熵决策分叉点——即学生真正不确定、通常需要深思熟虑的决策节点。正是在这些位置,学生的top-1 token往往为探索性标记,而依赖答案的教师的top-1 token则不是,这种不匹配产生强梯度,压制了真正驱动推理的token。最终结果是模型原生推理行为被显著抑制,下游推理准确率随之同步下降。

轨迹优化蒸馏(TRD) https://arxiv.org/abs/2606.08432 《重新思考大语言模型On-policy蒸馏》: https://arxiv.org/abs/2604.13016 《On-policy蒸馏的多重面相:陷阱、机制与修复》 https://arxiv.org/abs/2605.11182 《诊断与缓解On-policy自蒸馏中的思维崩塌》 https://arxiv.org/abs/2607.10805

《教师Token何时可靠?面向推理的位置加权On-policy自蒸馏》(http://arxiv.org/abs/2605.21606)指出,OPSD的标准目标函数对所有token一视同仁,将特权教师的输出视为学生访问的每个前缀上同样可靠的目标。但高教师熵具有歧义性——它既可表示不可行分支,也可表示良性的解法多样性。

我认为思维崩塌论文(https://arxiv.org/pdf/2607.10805)中的修复方法相当有趣,或许不是最简洁的方案,但思路精妙。 其核心直觉是:不要在所有位置信任特权自教师。思维崩塌仅发生在高熵决策分叉点——这些位置学生想要生成思考token(wait、maybe、alternatively),但已知道答案的教师则试图压制它们。论文发现这些位置位于高熵区域,且学生对其自身采样token的分配概率高于教师。仅在这些token处,他们将目标温和锚定回冻结的基础模型(原始学生基础策略),而非教师。在其他所有位置,则无此正则化地直接采用教师监督。

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。