在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号
摘要
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。
arXiv:2608.00782v1 公告类型:新
摘要:基于可验证奖励的强化学习(RLVR)已成为大语言模型(LLM)后训练的标准范式。虽然群体相对策略优化(GRPO)被广泛采用,但它存在奖励信号稀疏的问题,并且当组内所有响应获得相同奖励时,梯度会完全丢失。同策略蒸馏(OPD)通过从教师模型提供密集的、token级别的监督,提供了一种自然的补救方案。然而,将GRPO与OPD直接结合会导致性能下降,原因有三个:并非所有样本都受益于蒸馏;过快拟合教师模型会削弱RL的探索能力;OPD的优势是不对称的,会抑制大多数token。为了解决这些挑战,我们提出了RSTG(通过自适应教师指导恢复学习信号),它在最关键的地方选择性地、精确地应用蒸馏。在样本层面,OPD仅限于负的零方差提示,每个样本按教师模型的置信度得分加权。在token层面,蒸馏仅针对学生熵较高或教师与学生之间分歧较大的token。我们还利用教师模型生成的正确轨迹进行SFT来增强训练,在RL无法产生梯度的地方注入正梯度信号。实验表明,RSTG在数学和代码基准上分别比朴素的GRPO+OPD显著提高+4.02%和+3.05%。
查看缓存全文
缓存时间: 2026/08/04 07:44
在失败之处蒸馏:从自适应教师指导中恢复负RL组的学习信号
Zhuowen Han1, Jinwei Xiao2, Zhengxi Lu2, Renren Jin1, Zhiyuan Yao2, Yuxin Liu2, Hongyan Hao2, Yueqing Sun2, Yu Yang2, Qi Gu2, Xunliang Cai2, Deyi Xiong1,†
1天津大学计算机科学与技术学院 TJUNLP 实验室,2美团 Longcat 团队
{zwhan, dyxiong}@tju.edu.cn [email protected]
###### 摘要
可验证奖励的强化学习(RLVR)已成为大型语言模型(LLMs)后训练的标准范式。尽管组相对策略优化(GRPO)被广泛采用,但它存在奖励信号稀疏的问题,并且当组内所有响应获得完全相同的奖励时,梯度会完全消失。在策略蒸馏(OPD)通过从教师模型提供密集的、token级别的监督信号,自然地为这一问题提供了补救措施。然而,将GRPO与OPD朴素地组合会导致性能下降,其原因有三个:并非所有样本都能从蒸馏中受益;过快拟合教师会削弱RL的探索能力;OPD的优势具有不对称性,会抑制大多数token。为解决这些挑战,我们提出RSTG(通过自适应教师指导恢复学习信号),它选择性地且精准地在最关键的样本和token上应用蒸馏。在样本层面,OPD仅被用于负向零方差提示,每个样本按教师的置信度分数加权。在token层面,蒸馏仅针对学生熵较高或师生散度较大的token。我们还进一步利用教师模型生成的正确轨迹进行SFT,在RL无法提供梯度的地方注入正梯度信号。实验表明,RSTG在数学基准上比朴素GRPO+OPD显著提升+4.02%,在代码基准上提升+3.05%。
在失败之处蒸馏:从自适应教师指导中恢复负RL组的学习信号
Zhuowen Han1, Jinwei Xiao2, Zhengxi Lu2, Renren Jin1, Zhiyuan Yao2, Yuxin Liu2, Hongyan Hao2, Yueqing Sun2, Yu Yang2, Qi Gu2, Xunliang Cai2, Deyi Xiong1,†
1天津大学计算机科学与技术学院 TJUNLP 实验室,2美团 Longcat 团队
{zwhan, dyxiong}@tju.edu.cn [email protected]
†通讯作者
## 1 引言
通过可验证奖励的强化学习(RLVR)对大型语言模型(LLMs)进行后训练,已成为提升推理能力的标准方法(Team, 2025b (https://arxiv.org/html/2608.00782#bib.bib14); DeepSeek-AI, 2025 (https://arxiv.org/html/2608.00782#bib.bib16); Team, 2025a (https://arxiv.org/html/2608.00782#bib.bib18))。在RLVR方法中,组相对策略优化(GRPO;Shao et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib17))因其简单和稳定而被广泛采用。GRPO对一组采样输出中的结果奖励进行归一化,以估计一个应用于每个token的标量优势,这导致奖励稀疏(Li et al., 2026c (https://arxiv.org/html/2608.00782#bib.bib38)),并且当所有采样输出都正确或都错误时梯度会消失;我们将这类提示分别称为正向和负向零方差提示(Zheng et al., 2025 (https://arxiv.org/html/2608.00782#bib.bib19); Feng et al., 2025 (https://arxiv.org/html/2608.00782#bib.bib20))。
参见图注
图1:MATH上的训练动态。朴素GRPO+OPD效果不佳,而我们的RSTG取得了更高的性能。
近期工作已转向在策略蒸馏(OPD;Agarwal et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib21); Gu et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib22)),该方法让学生自行生成采样轨迹,并利用教师的逐token对数概率作为密集奖励信号,自然地弥补了GRPO的局限。一种直接的做法是通过将两者损失相加来用OPD补充GRPO(Agarwal et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib21))。然而,如图1所示,这种朴素组合的性能不如标准GRPO,即使对OPD系数采用退火调度(Xu et al., 2025 (https://arxiv.org/html/2608.00782#bib.bib11)),结果仍不理想。
我们确定了这种朴素组合失效的三个关键原因:(1)**样本层面的均匀性**:并非所有样本都能从OPD中受益;教师指导的质量取决于教师在该样本上的熟练程度。(2)**教师受限性**:OPD收敛很快,且性能上限为教师水平。过早收敛到教师水平会严重削弱RL的探索能力。(3)**优势不对称性**:学生生成的token通常被教师赋予较低概率,导致大多数token级优势为负(Fu et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib2); Jia et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib3); Ko et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib27); Lu et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib5)),从而抑制学习信号。此外,OPD本质上是局部的,它基于可能错误的学生生成前缀进行条件化,因此会产生不可靠的梯度(Fu et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib2))。
为解决上述局限,我们提出RSTG(通过自适应教师指导恢复学习信号)。(1)**样本选择**:仅在学生失败但教师成功的提示上应用OPD,其性能优于在所有样本上应用标准OPD,而仅使用全部数据的3.63%。因此,我们仅在负向零方差提示上应用OPD,并用教师对每个提示的掌握程度来加权蒸馏信号。(2)**Token选择**:我们将OPD梯度更新限制在学生具有高熵或师生散度较大的token上,以减缓收敛速度并减少梯度噪声。(3)**辅助SFT**:在负向零方差提示上,我们对教师模型预先生成的正确轨迹进行SFT,注入正梯度信号,并提供全局视角以缓解OPD的局部性。
我们在Qwen2.5和Qwen3模型系列上,在数学和代码基准上验证了RSTG。RSTG相比朴素GRPO+OPD取得了显著提升(数学+4.02%,代码+3.05%),同时缓解了优势不对称、减缓了对教师的收敛速度,并防止了响应长度的突然膨胀。
总之,我们的贡献如下:
- 我们确定了OPD的适用范围,并证明了教师熟练程度对其有效性的影响。
- 我们提出了RSTG,使GRPO与OPD能够有效结合。
## 2 相关工作
#### 在策略蒸馏(OPD)。
知识蒸馏(Hinton et al., 2015 (https://arxiv.org/html/2608.00782#bib.bib24))将能力从教师模型迁移到学生模型。OPD(Agarwal et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib21); Gu et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib22); Ko et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib27))从学生模型中采样轨迹,并将其与教师的token级logits分布对齐,提供密集的在策略监督,天然地补充了GRPO。目前存在两种主要范式:GKD式OPD直接将token级KL散度作为训练损失(Agarwal et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib21));而PG式OPD将逐token反向KL作为密集奖励信号,并通过策略梯度更新学生,其中优势被定义为反向KL的负值(Ko et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib27); Yang et al., 2026a (https://arxiv.org/html/2608.00782#bib.bib25))。我们采用后者,它能自然地与RL框架统一(Yang et al., 2026b (https://arxiv.org/html/2608.00782#bib.bib23))。
#### 结合RL与OPD。
已有工作探索了将RL与知识蒸馏相结合,以同时利用奖励信号和教师监督。GKD(Agarwal et al., 2024 (https://arxiv.org/html/2608.00782#bib.bib21))首次在文本摘要中探索了这种统一,KDRL(Xu et al., 2025 (https://arxiv.org/html/2608.00782#bib.bib11))进一步推进了这一方向。最近,越来越多的研究开始探索将RL与在策略自蒸馏(OPSD)相结合(Yang et al., 2026a (https://arxiv.org/html/2608.00782#bib.bib25); Li et al., 2026a (https://arxiv.org/html/2608.00782#bib.bib26); Lu et al., 2026 (https://arxiv.org/html/2608.00782#bib.bib5))。然而,这一范式仍面临重大挑战,现有方法往往在更广泛的模型和设置中失效。RSTG旨在使这种组合更加鲁棒和有效。
## 3 预备知识相似文章
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。
通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习
本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。
用于大语言模型后训练的蒸馏强化学习
介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。
自蒸馏策略梯度
SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。
蒸馏学生路径:面向英文证据跨语言RAG的教师正则化强化学习
提出TR-RAG,一种面向英文证据跨语言RAG的教师正则化强化学习方案,将奖励优化与在线策略蒸馏相结合,以解决语言漂移和证据使用不可靠的问题。实验表明,在多个基准测试中,该方法在语言一致性和基于证据的正确性方面均有提升。