信任区域策略蒸馏

Hugging Face Daily Papers 论文

摘要

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

大的目标很难一次性实现;将其分解为小步骤更为明智。我们提出了信任区域策略蒸馏(TOP-D),它通过动态构建近端教师,将出了名不稳定、高方差的在线策略蒸馏(OPD)转变为稳定的训练范式。理论上,我们建立了一个严格的框架,证明TOP-D本质上控制了梯度方差。通过提供正式的全局收敛分析和单调改进界,我们数学形式化了整个训练动态的可靠性和稳定性。实证上,TOP-D在数学推理任务上显著提升了训练稳定性、样本效率和最终性能。更重要的是,TOP-D引入了零额外计算开销,使其成为成熟的OPD范式的一个有前景的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:50

论文页面 - Trust Region Policy Distillation

来源:https://huggingface.co/papers/2607.04751

摘要

宏大目标难以一蹴而就,将其分解为小步骤是更明智的做法。我们提出了Trust Region Policy Distillation (TOP-D),通过动态构建一个近端教师(proximal teacher),将原本极不稳定、高方差的在线策略蒸馏(On-Policy Distillation, OPD)转化为稳定的训练范式。理论上,我们建立了一个严谨的框架,证明TOP-D天然地控制了梯度方差。通过提供正式的全局收敛性分析以及单调改进界,我们从数学上形式化了整体训练动力学的可靠性与稳定性。实验上,TOP-D在数学推理任务上显著提升了训练稳定性、样本效率和最终性能。更重要的是,TOP-D引入了零额外计算开销,使其成为成熟的OPD范式中一个有前景的替代方案。

查看 arXiv 页面(https://arxiv.org/abs/2607.04751)查看 PDF(https://arxiv.org/pdf/2607.04751)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04751)

在你的agent中获取该论文:

hf papers read 2607\.04751

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

无模型链接该论文

在模型 README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。

引用该论文的数据集 0

无数据集链接该论文

在数据集 README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。

引用该论文的Space 0

无Space链接该论文

在Space README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。

包含该论文的合集 2

相似文章

Trust Region On-Policy Distillation

Hugging Face Daily Papers

本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。

面向在线策略蒸馏的信任区域行为融合

Hugging Face Daily Papers

信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。