KL的KL: 使用控制变量基线的在策略蒸馏

Hugging Face Daily Papers 论文

摘要

提出了vOPD,通过引入强化学习中的控制变量基线,稳定了大语言模型的在策略蒸馏,实现了与昂贵全词表方法相当的性能,同时计算成本更低。

在策略蒸馏(OPD)已成为大语言模型(特别是推理领域)的主要后训练范式。然而,由于单样本蒙特卡洛估计器的高梯度方差,OPD在实践中仍不稳定,稳定训练的配方尚不成熟。我们提出了vOPD(使用控制变量基线的在策略蒸馏),将OPD视为策略梯度强化学习问题,并通过引入强化学习文献中的控制变量基线(通常是一个价值函数)来稳定训练。我们证明,OPD价值函数具有闭合形式,即学生模型与教师模型之间每个词元的负反向KL散度,可直接从已计算的前向传播中获得,无需额外的评论家或推理。现有的稳定方法要么计算整个词汇表上所有词元的反向KL,带来显著开销,要么将其限制在top-k支持集上,从而引入偏差。vOPD则保留了轻量级的单样本估计器,通过减去作为分离基线的价值函数,在保持梯度无偏的同时降低方差。此外,我们证明了基线的top-k近似可进一步降低成本而不影响性能。在数学和科学推理基准测试中,vOPD始终优于原始OPD,并与最昂贵的全词表基线性能相当,通过原理性的强化学习方差缩减提供了在策略蒸馏的高效稳定方法。
查看原文
查看缓存全文

缓存时间: 2026/05/15 04:24

论文页面 - KL 用于 KL:带控制变量基线的在线策略蒸馏

来源:https://huggingface.co/papers/2605.07865

摘要

带控制变量基线的在线策略蒸馏通过策略梯度强化学习技术稳定训练过程,同时保持效率和性能。

在线策略蒸馏(On-Policy Distillation, OPD)已成为大型语言模型(尤其是推理领域)主导的后训练范式。然而,OPD 在实践中仍然不稳定,原因是其单样本蒙特卡洛估计器(Monte Carlo estimator)存在高梯度方差(gradient variance),且稳定训练的成熟方案尚未完善。我们提出 vOPD(带控制变量基线(control variate baseline)的在线策略蒸馏),它将 OPD 转化为策略梯度强化学习(policy-gradient RL),并通过引入强化学习文献中的控制变量基线(canonically 一个价值函数(value function))来稳定训练。我们证明,OPD 的价值函数具有封闭形式,即学生与教师之间每个 token 的负反向 KL 散度(reverse KL divergence),可直接从已计算的正向传播中获取,无需额外批评网络或推理。现有的稳定方法要么计算整个词汇表上的完整 token 级反向 KL(token-level reverse KL),带来显著开销,要么将其限制在 top-k 支持集上,从而引入偏差目标。vOPD 则保留轻量级的单样本估计器,减去价值函数(作为分离的基线)以保持梯度无偏,同时降低方差。此外,我们证明基线的 top-k 近似(top-k approximation)可在不牺牲性能的前提下进一步降低成本。在数学和科学推理基准上,vOPD 始终优于原始 OPD,并与最昂贵的全词汇表基线性能相当,通过基于原则的强化学习方差缩减(variance reduction)实现了高效的在线策略蒸馏稳定化。

查看 arXiv 页面 (https://arxiv.org/abs/2605.07865) 查看 PDF (https://arxiv.org/pdf/2605.07865) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.07865)

在您的代理中获取本篇论文:

hf papers read 2605.07865

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无关联此论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2605.07865 以从此页面链接。

引用此论文的数据集 0

无关联此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2605.07865 以从此页面链接。

引用此论文的 Space 0

无关联此论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2605.07865 以从此页面链接。

包含此论文的收藏集 0

无包含此论文的收藏集

请将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

论同策略蒸馏的几何结构

Hugging Face Daily Papers

本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

ShortOPD:通过短到长在策略蒸馏恢复剪枝后的大语言模型

arXiv cs.LG

ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。