H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers 论文

摘要

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。

可验证奖励的强化学习(RLVR)显著提升了大型语言模型在数学推理和代码生成等任务上的推理能力。然而,大多数RLVR方法为整个轨迹分配标量结果奖励,导致监督稀疏且token级信用分配有限。在线蒸馏(OPD)通过从更强的教师模型蒸馏token级分布来提供更密集的监督,但需要额外的教师模型且通常假设共享词汇表。在线自我蒸馏(OPSD)通过在同一模型上基于特权信息构建教师策略来消除这一依赖。然而,直接匹配教师分布可能导致信息泄露和不稳定的优化。RLSD通过仅使用教师信号调节更新幅度来避免直接匹配,但在采样推理失败时无法提供显式的纠正方向。为解决这一权衡,我们提出H^2SD,一种混合事后自我蒸馏框架,根据轨迹正确性以不同方式使用教师模型。对于成功轨迹,教师模型接收经确认为正确的学生回答以及一条改写指令,其对原始回答token的概率仅用于调节更新幅度,而不改变奖励确定的更新方向。对于失败轨迹,教师模型基于包含关键推理步骤和已验证答案的参考提示,最小化学生模型到教师模型的反向KL散度。在多个具有挑战性的推理基准上的实验表明,H^2SD在保持稳定优化和良好生成效率的同时,始终优于代表性的RLVR、OPSD和RLSD基线。
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:40

论文页面 - H²SD: 混合后见自蒸馏

来源:https://huggingface.co/papers/2607.18955

摘要

基于可验证奖励的强化学习(RLVR)显著提升了大语言模型在数学推理和代码生成等任务上的推理能力。然而,大多数RLVR方法将标量结果奖励分配给整个轨迹,导致监督稀疏且令牌级信用分配受限。在线策略蒸馏(OPD)通过从更强的教师模型中蒸馏令牌级分布来提供更密集的监督,但需要额外的教师模型,且通常假设共享词汇表。在线策略自蒸馏(OPSD)通过让同一模型基于特权信息构建教师策略来消除这一依赖。然而,直接匹配教师分布可能导致信息泄露和优化不稳定。RLSD通过仅利用教师信号调节更新幅度来避免直接匹配,但在采样推理失败时无法提供明确的修正方向。为了解决这一权衡,我们提出了H²SD,一种混合后见自蒸馏框架,根据轨迹的正确性以不同方式使用教师模型。对于成功轨迹,教师模型接收已被确认为正确的学生响应以及改写指令,并利用其对原始响应令牌的概率来调节更新幅度,同时不改变由奖励确定的更新方向。对于失败轨迹,我们让教师模型基于包含关键推理步骤和已验证答案的参考提示进行条件化,并最小化学生到教师的反向KL散度。在多个具有挑战性的推理基准上的实验表明,H²SD在保持稳定优化和良好生成效率的同时,始终优于代表性的RLVR、OPSD和RLSD基线。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18955)查看 PDF (https://arxiv.org/pdf/2607.18955)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18955)

在您的 agent 中获取此论文:

hf papers read 2607.18955

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

未找到引用此论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2607.18955 以从本页链接。

引用本论文的数据集0

未找到引用此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2607.18955 以从本页链接。

引用本论文的 Spaces0

未找到引用此论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2607.18955 以从本页链接。

包含本论文的收藏集0

未找到包含此论文的收藏集

将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。

Learning More from Less: 从后见之明中进行强化学习

arXiv cs.LG

介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

Hugging Face Daily Papers

提出反自蒸馏(AntiSD),该方法逆转自蒸馏中的知识转移方向,以提高数学推理的效率和准确率,在4B到30B参数的多个模型上,用2-10倍更少的训练步数达到GRPO基线的准确率,最终准确率最高提升11.5个百分点。

自蒸馏策略梯度

arXiv cs.LG

SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。

用于LLM推理的自适应教师暴露自蒸馏方法

Hugging Face Daily Papers

自适应教师暴露自蒸馏(ATESD)通过可学习的策略控制器和折扣学习进度奖励动态调整教师向学生展示参考推理的比例,从而提升LLM推理能力。在数学基准上的实验表明,该方法相较于现有自蒸馏和强化学习基线均取得了一致改进。