自蒸馏策略梯度
摘要
本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - 自我蒸馏策略梯度
来源:https://huggingface.co/papers/2606.04036
摘要
一个自我蒸馏策略梯度框架结合了在线自我蒸馏、验证器优势以及KL正则化,以提升强化学习的稳定性和性能。
在线自我蒸馏(https://huggingface.co/papers?q=self-distillation)是指语言模型通过利用特权上下文来监督自身生成,这为稀疏奖励强化学习(https://huggingface.co/papers?q=reinforcement%20learning)提供了有前景的密集监督信号。实际上,它可以实例化为一个辅助的全词汇学生到教师的反向Kullback-Leibler散度(https://huggingface.co/papers?q=reverse%20Kullback-Leibler%20divergence)损失函数。因此,我们提出了SDPG,一个自我蒸馏策略梯度(https://huggingface.co/papers?q=policy-gradient)框架,该框架结合了基于归一化标准差的组相对验证器优势(https://huggingface.co/papers?q=verifier%20advantages)、精确的全词汇在线自我蒸馏(https://huggingface.co/papers?q=self-distillation)以及参考策略KL正则化(https://huggingface.co/papers?q=KL%20regularization)。实验表明,SDPG相比RLVR和自我蒸馏基线在稳定性和性能上均有提升。代码已在https://github.com/lauyikfung/SDPG上公开。
查看arXiv页面(https://arxiv.org/abs/2606.04036)查看PDF(https://arxiv.org/pdf/2606.04036)项目页面(https://lauyikfung.github.io/SDPG/)GitHub0(https://github.com/lauyikfung/SDPG)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.04036)
在你的代理中获取此论文:
hf papers read 2606\.04036
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
请在模型README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。
引用此论文的Spaces0
暂无Space链接此论文
请在Space README.md中引用arxiv.org/abs/2606.04036以在此页面建立链接。
包含此论文的收藏集1
相似文章
自蒸馏策略梯度
SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。
自蒸馏实现持续学习 [pdf]
介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。
向自我未来学习:面向扩散大语言模型的自策略知识蒸馏
介绍了 d-OPSD,这是首个面向扩散大语言模型的自策略知识蒸馏框架,采用后缀条件和步骤级别监督,在推理基准上优于 RLVR 和 SFT 基线。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
SEED: 面向智能体强化学习的自进化在线策略蒸馏
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。