@BhavinJawade: **在线策略蒸馏并非免费午餐** 在线策略蒸馏已成为默认做法…
摘要
Bhavin Jawade 讨论了在线策略蒸馏在大语言模型训练中的几种失败模式,包括早期错误变得无法纠正、更强的教师反而更差、基于特权信息的条件化无法迁移,以及密集监督导致的思维崩溃。
查看缓存全文
缓存时间: 2026/07/22 08:29
On-policy蒸馏并非免费的午餐
On-policy蒸馏已成为许多开源前沿模型训练配方中默认的后训练工具。近期发布的模型大量依赖此技术:DeepSeek v4、MiMO和Nemotron-Cascade-2使用MOPD,GLM 5.x则采用on-policy跨阶段自蒸馏。它利用RL的on-policy特性减少暴露偏差,同时提供类似SFT的token级监督。 但OPD和OPSD有其自身的失败模式。本文讨论其中几点:
-
早期错误在结构上不可纠正。当学生模型采样一条轨迹并过早转向错误方向时,沿该冻结轨迹计算的逐token KL散度无法将其拉回正确路径。TRD证明这种失败内置于目标函数本身,而非梯度噪声问题。即使拥有完美教师模型,基于学生自身轨迹的token级KL梯度仅在分歧发生的第一个token处与理想校正梯度一致,此后所有后续token的梯度方向均相悖。因此每个后续的监督目标都锚定在学生本不该进入的上下文中。由于重加权或裁剪仅缩放每个token梯度的幅度,而当这些梯度方向错误时,任何逐token调整都无法恢复正确更新。TRD提出的修复方案是沿教师优化后的轨迹进行蒸馏,而非原始学生轨迹,从而恢复学生实际可遵循的目标。
-
更强的教师可能成为更差的教师。On-policy蒸馏只能在学生自身访问的状态上教学,而每个状态的可利用信号存在于学生与教师下一个token分布的重叠区域。《重新思考OPD》表明,更大、评分更高的教师可能无法推动学生进步,而较弱教师却能成功。这是因为若教师的token分布将其概率质量集中在学生极少生成的token上,则重叠区域极小,无论教师绝对能力多强,几乎没有任何知识迁移。真正预测成功的是早期top-k思维模式重叠度。在成功的训练中,共享的top-k token承载97-99%的概率质量,且重叠率在训练中稳步上升;而初始重叠度低的训练运行永远无法恢复。采用与学生相同配方训练的教师会收敛到学生自身的分布,因此其更高的基准分数并不对应任何可迁移的新知识。实践准则是根据与学生分布的接近程度选择教师,而非排行榜排名。
-
特权信息条件化OPSD可能迁移失败。在OPSD中,你将依赖特权信息(如标准答案)的教师蒸馏到永远无法获取该信息的学生中。《OPD的多重面相》揭示了当这些信息为实例特定时会出现的问题。学生无法恢复教师逐实例的推理过程(因永远看不到答案),因此它学习单一的与答案无关的策略,实质上平均化了教师在所有问题上的行为,而该平均策略过于泛化,无法解决任何特定问题。其标志是初始提升后迅速崩溃:生成轨迹变长、充斥模棱两可的token、准确率跌向零。该方法仅在特权信息为适用于所有实例的共享规则(如系统提示或对齐偏好)时有效,而不适用于每个问题的具体答案。
-
思维崩塌:密集监督压制模型自身的思考过程。依赖答案的教师没有理由犹豫、回溯或探索,因此其逐token目标会悄悄压制学生的思考token。《诊断与缓解思维崩塌》将这一现象命名为思维崩塌:随着训练进行,学生原生推理行为逐渐退化,承载推理过程的探索性token(如“wait“、“maybe”、“alternatively”)频率持续降低。该机制具有局部性而非全局性。损害集中在高熵决策分叉点——即学生真正不确定、通常需要深思熟虑的决策节点。正是在这些位置,学生的top-1 token往往为探索性标记,而依赖答案的教师的top-1 token则不是,这种不匹配产生强梯度,压制了真正驱动推理的token。最终结果是模型原生推理行为被显著抑制,下游推理准确率随之同步下降。
轨迹优化蒸馏(TRD) https://arxiv.org/abs/2606.08432 《重新思考大语言模型On-policy蒸馏》: https://arxiv.org/abs/2604.13016 《On-policy蒸馏的多重面相:陷阱、机制与修复》 https://arxiv.org/abs/2605.11182 《诊断与缓解On-policy自蒸馏中的思维崩塌》 https://arxiv.org/abs/2607.10805
《教师Token何时可靠?面向推理的位置加权On-policy自蒸馏》(http://arxiv.org/abs/2605.21606)指出,OPSD的标准目标函数对所有token一视同仁,将特权教师的输出视为学生访问的每个前缀上同样可靠的目标。但高教师熵具有歧义性——它既可表示不可行分支,也可表示良性的解法多样性。
我认为思维崩塌论文(https://arxiv.org/pdf/2607.10805)中的修复方法相当有趣,或许不是最简洁的方案,但思路精妙。 其核心直觉是:不要在所有位置信任特权自教师。思维崩塌仅发生在高熵决策分叉点——这些位置学生想要生成思考token(wait、maybe、alternatively),但已知道答案的教师则试图压制它们。论文发现这些位置位于高熵区域,且学生对其自身采样token的分配概率高于教师。仅在这些token处,他们将目标温和锚定回冻结的基础模型(原始学生基础策略),而非教师。在其他所有位置,则无此正则化地直接采用教师监督。
相似文章
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
@BhavinJawade:我正在调研探讨和解释在线策略蒸馏及其变体失败模式的论文。
BhavinJawade 调研了关于在线策略蒸馏及其变体失败模式的论文,列出了近期多篇 arXiv 论文,包括《The Many Faces of On-Policy Distillation》等。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。