信任区域策略蒸馏
摘要
信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。
查看缓存全文
缓存时间: 2026/07/13 07:50
论文页面 - Trust Region Policy Distillation
来源:https://huggingface.co/papers/2607.04751
摘要
宏大目标难以一蹴而就,将其分解为小步骤是更明智的做法。我们提出了Trust Region Policy Distillation (TOP-D),通过动态构建一个近端教师(proximal teacher),将原本极不稳定、高方差的在线策略蒸馏(On-Policy Distillation, OPD)转化为稳定的训练范式。理论上,我们建立了一个严谨的框架,证明TOP-D天然地控制了梯度方差。通过提供正式的全局收敛性分析以及单调改进界,我们从数学上形式化了整体训练动力学的可靠性与稳定性。实验上,TOP-D在数学推理任务上显著提升了训练稳定性、样本效率和最终性能。更重要的是,TOP-D引入了零额外计算开销,使其成为成熟的OPD范式中一个有前景的替代方案。
查看 arXiv 页面(https://arxiv.org/abs/2607.04751)查看 PDF(https://arxiv.org/pdf/2607.04751)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04751)
在你的agent中获取该论文:
hf papers read 2607\.04751
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。
引用该论文的数据集 0
无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。
引用该论文的Space 0
无Space链接该论文
在Space README.md 中引用 arxiv.org/abs/2607.04751 以链接至此页面。
包含该论文的合集 2
相似文章
Trust Region On-Policy Distillation
本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。
面向在线策略蒸馏的信任区域行为融合
信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
教师令牌何时可靠?基于位置加权的在线策略自蒸馏方法在推理中的应用
本文发现,推理蒸馏中教师令牌的可靠性具有轨迹结构特性,并提出了基于位置加权的在线策略自蒸馏方法(PW-OPSD),该方法通过应用递增的位置权重,在不增加教师计算量的情况下提升了性能。