揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers 论文

摘要

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

On-policy distillation(OPD)已成为LLM后训练中的关键范式,但其训练动态仍未被充分理解。我们开展了一项系统性研究,审视了OPD的角色、病理与调控。我们首先阐明了OPD作为探索催化剂的作用:它通过密集的token级引导,将学生模型导向正确的推理路径,而不扩展能力上限。我们通过以下方式证实了这一点:提示多样性比每个问题的采样数量更重要,而且关键的是,OPD的有效性完全依赖于其引导信号的质量。这种依赖性暴露了两种破坏探索的病理现象。当教师-学生分布差距较大,导致引导信号与任务正确性不一致,从而将探索引向适得其反的方向时,就会出现Student-Teacher Mismatch。当聚合的token级目标产生长度相关的捷径,允许学生通过截断响应或冗余填充来操纵奖励分布,探索退化的长度模式而非推理策略时,就会产生Length Exploitation。为了控制这些病理现象,我们研究了轻量级信号调控方法:优势裁剪和对数尺度压缩,确保探索由可靠的信号引导。在七个基准上的实验表明,这些调控减轻了长度利用问题,并实现了有效的蒸馏,稳定地超越了OPD变体和RLVR基线,从而证实了在OPD中,良好的调控信号质量而非单纯的教师模型规模决定了成功的探索。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:43

论文页面 - 揭秘同策略蒸馏:角色、病理与调控

来源:https://huggingface.co/papers/2607.13399

摘要

同策略蒸馏(On-Policy Distillation, OPD)已成为大型语言模型后训练的关键范式,然而其训练动态仍未被充分理解。我们进行了一项系统性研究,深入探究OPD的角色、病理与调控机制。首先,我们阐明OPD作为探索催化剂的作用:它通过密集的逐token引导,将学生模型导向正确的推理路径,但不会提升能力上限。我们通过实验证实,提示多样性比每个问题的采样数量更为关键,并且重要的是,OPD的有效性完全取决于其引导信号的质量。这种依赖性暴露了两种阻碍探索的病理现象。师生不匹配发生在教师与学生分布差距过大时,导致引导信号与任务正确性发生错位,从而将探索引向反方向。长度利用则源于聚合的逐token目标函数创造了依赖长度的捷径,使得学生模型能够通过截断响应或冗余填充来操纵奖励空间,从而探索退化的长度模式而非推理策略。为抑制这些病理,我们研究了轻量级的信号调控方法:优势裁剪和对数尺度压缩,确保探索由可信信号引导。在七个基准上的实验表明,这些调控缓解了长度利用,实现了有效的蒸馏,稳定地超越了OPD变体和RLVR基线,从而证实:在OPD中,成功的探索取决于调控良好的信号质量,而非单纯的教师规模。

查看arXiv页面 (https://arxiv.org/abs/2607.13399)查看PDF (https://arxiv.org/pdf/2607.13399)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.13399)

在您的代理中获取此论文:

hf papers read 2607.13399

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

无模型链接到此论文

请在模型README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该模型。

引用该论文的数据集0

无数据集链接到此论文

请在数据集README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该数据集。

引用该论文的Spaces0

无Spaces链接到此论文

请在Spaces README.md中引用arxiv.org/abs/2607.13399,以便从此页面链接该Spaces。

包含该论文的集合2

相似文章

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。