自蒸馏策略梯度

Hugging Face Daily Papers 论文

摘要

本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。

在线策略自蒸馏——语言模型基于特权上下文监督自身生成——是为稀疏奖励强化学习提供密集监督的一种有前景的方式。实际上,它可以实例化为辅助的全词汇学生到教师反向KL散度损失。因此,我们提出SDPG,一种自蒸馏策略梯度框架,结合了组相对验证器优势与归一化标准差、精确的全词汇在线策略自蒸馏,以及参考策略KL正则化。实验表明,SDPG相较于RLVR和自蒸馏基线提升了稳定性和性能。代码详见 https://github.com/lauyikfung/SDPG。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - 自我蒸馏策略梯度

来源:https://huggingface.co/papers/2606.04036

摘要

一个自我蒸馏策略梯度框架结合了在线自我蒸馏、验证器优势以及KL正则化,以提升强化学习的稳定性和性能。

在线自我蒸馏(https://huggingface.co/papers?q=self-distillation)是指语言模型通过利用特权上下文来监督自身生成,这为稀疏奖励强化学习(https://huggingface.co/papers?q=reinforcement%20learning)提供了有前景的密集监督信号。实际上,它可以实例化为一个辅助的全词汇学生到教师的反向Kullback-Leibler散度(https://huggingface.co/papers?q=reverse%20Kullback-Leibler%20divergence)损失函数。因此,我们提出了SDPG,一个自我蒸馏策略梯度(https://huggingface.co/papers?q=policy-gradient)框架,该框架结合了基于归一化标准差的组相对验证器优势(https://huggingface.co/papers?q=verifier%20advantages)、精确的全词汇在线自我蒸馏(https://huggingface.co/papers?q=self-distillation)以及参考策略KL正则化(https://huggingface.co/papers?q=KL%20regularization)。实验表明,SDPG相比RLVR和自我蒸馏基线在稳定性和性能上均有提升。代码已在https://github.com/lauyikfung/SDPG上公开。

查看arXiv页面(https://arxiv.org/abs/2606.04036)查看PDF(https://arxiv.org/pdf/2606.04036)项目页面(https://lauyikfung.github.io/SDPG/)GitHub0(https://github.com/lauyikfung/SDPG)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.04036)

在你的代理中获取此论文:

hf papers read 2606\.04036

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

请在模型README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。

引用此论文的Spaces0

暂无Space链接此论文

请在Space README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。

包含此论文的收藏集1

相似文章

自蒸馏策略梯度

arXiv cs.LG

SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。

自蒸馏实现持续学习 [pdf]

Hacker News Top

介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。