揭秘 On-Policy Distillation:角色、病理与调控
摘要
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
查看缓存全文
缓存时间: 2026/07/20 09:43
论文页面 - 揭秘同策略蒸馏:角色、病理与调控
来源:https://huggingface.co/papers/2607.13399
摘要
同策略蒸馏(On-Policy Distillation, OPD)已成为大型语言模型后训练的关键范式,然而其训练动态仍未被充分理解。我们进行了一项系统性研究,深入探究OPD的角色、病理与调控机制。首先,我们阐明OPD作为探索催化剂的作用:它通过密集的逐token引导,将学生模型导向正确的推理路径,但不会提升能力上限。我们通过实验证实,提示多样性比每个问题的采样数量更为关键,并且重要的是,OPD的有效性完全取决于其引导信号的质量。这种依赖性暴露了两种阻碍探索的病理现象。师生不匹配发生在教师与学生分布差距过大时,导致引导信号与任务正确性发生错位,从而将探索引向反方向。长度利用则源于聚合的逐token目标函数创造了依赖长度的捷径,使得学生模型能够通过截断响应或冗余填充来操纵奖励空间,从而探索退化的长度模式而非推理策略。为抑制这些病理,我们研究了轻量级的信号调控方法:优势裁剪和对数尺度压缩,确保探索由可信信号引导。在七个基准上的实验表明,这些调控缓解了长度利用,实现了有效的蒸馏,稳定地超越了OPD变体和RLVR基线,从而证实:在OPD中,成功的探索取决于调控良好的信号质量,而非单纯的教师规模。
查看arXiv页面 (https://arxiv.org/abs/2607.13399)查看PDF (https://arxiv.org/pdf/2607.13399)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.13399)
在您的代理中获取此论文:
hf papers read 2607.13399
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
无模型链接到此论文
请在模型README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该模型。
引用该论文的数据集0
无数据集链接到此论文
请在数据集README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该数据集。
引用该论文的Spaces0
无Spaces链接到此论文
请在Spaces README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该Spaces。
包含该论文的集合2
相似文章
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。