用于大语言模型后训练的蒸馏强化学习

Hugging Face Daily Papers 论文

摘要

介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。

大语言模型(LLM)后训练对于提升推理、适应能力和对齐至关重要。现有方法主要遵循两种范式:强化学习(RL)和同策略蒸馏(OPD)。然而,RL依赖粗粒度的结果监督,导致信用分配困难,且获取新知识的能力有限。而OPD通过KL散度无条件地匹配教师logits,这造成了一个困境:相似的教师无法提供新知识,而差异较大的教师往往给出无效指导,这极大地限制了OPD在同族蒸馏中的应用。我们提出了蒸馏强化学习(Distilled RL),该方法将教师监督融入RL目标中,以提供细粒度指导,选择性转移新知识并避免无条件模仿。蒸馏强化学习包含三个组成部分:带裁剪的反向重要性采样、负样本重置和序列级几何归一化。通过一个简洁且可解释的案例研究,我们证明了蒸馏强化学习能够有效将教师模型中先前不可用的知识迁移至学生模型。在同族和跨族蒸馏设置下的大量实验表明,蒸馏强化学习在pass@1和pass@k指标上均显著优于标准RL和OPD。我们的代码可在 https://github.com/597358816/Distilled-RL 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - 面向 LLM 后训练的蒸馏强化学习

来源:https://huggingface.co/papers/2607.17247

https://huggingface.co/papers/2607.17247#distilled-reinforcement-learning-for-llm-post-training面向 LLM 后训练的蒸馏强化学习

arXiv (https://arxiv.org/abs/2607.17247)GitHub (https://github.com/597358816/Distilled-RL)

标准强化学习依赖粗粒度的结果奖励,而在线策略蒸馏通常无条件地鼓励学生模仿教师分布。相比之下,蒸馏强化学习利用教师在 token 级别重新分配策略梯度信号,在保留奖励驱动优化的同时提供选择性且细粒度的指导。

https://huggingface.co/papers/2607.17247#overview概述

distilled-RL-main (https://cdn-uploads.huggingface.co/production/uploads/67d139a2c37dc49c9b4427e1/oakRP-GudVK-lDj4z9YiI.png)

蒸馏强化学习包含三个组件:

  1. 反向重要性采样,衡量教师对每个学生生成 token 的相对偏好。
  2. 负样本重置,在负优势轨迹上禁用教师重新加权。
  3. 序列级几何归一化,移除序列级尺度偏差,同时保留相对 token 偏好。

https://huggingface.co/papers/2607.17247#method方法

给定提示 q 以及从旧学生策略中采样的回答 o\_i,标准策略比率为

`` ri,t(θ)=πθ(oi,t∣q,oi,1:t−1)πold(oi,t∣q,oi,1:t−1) r_{i,t}(\theta)

\frac{ \pi_{\theta}(o_{i,t} \mid q, o_{i,1:t-1}) }{ \pi_{\mathrm{old}}(o_{i,t} \mid q, o_{i,1:t-1}) } ``

回答级别的优势使用组归一化奖励进行估计:

`` Ai=Ri−mean({Rj}j=1G)std({Rj}j=1G). A_i

\frac{ R_i - \mathrm{mean}({R_j}{j=1}^{G}) }{ \mathrm{std}({R_j}{j=1}^{G}) }. ``

https://huggingface.co/papers/2607.17247#reverse-importance-sampling反向重要性采样

我们使用以下公式衡量教师对每个学生生成 token 的相对偏好:

`` ρi,t=πteacher(oi,t∣q,oi,1:t−1)πθold(oi,t∣q,oi,1:t−1). \rho_

\frac{ \pi_{\mathrm{teacher}}(o_{i,t} \mid q, o_{i,1:t-1}) }{ \pi_{\theta_{\mathrm{old}}}(o_{i,t} \mid q, o_{i,1:t-1}) }. ``

为防止极端的教师-学生似然比,我们应用对称裁剪:

`` ρˉi,t=clip(ρi,t,ερ−1,ερ). \bar{\rho}_

\mathrm{clip} \left( \rho_{i,t}, \epsilon_{\rho}^{-1}, \epsilon_{\rho} \right). ``

https://huggingface.co/papers/2607.17247#sequence-level-geometric-normalization序列级几何归一化

在每个回答内部对裁剪后的比率进行归一化:

`` ρ~i,t=ρˉi,texp⁡(1∣oi∣∑s=1∣oi∣log⁡ρˉi,s). \widetilde{\rho}_

\frac{ \bar{\rho}{i,t} }{ \exp \left( \frac{1}{|o_i|} \sum{s=1}^{|o_i|} \log \bar{\rho}_{i,s} \right) }. ``

归一化后的比率满足

`` (∏t=1∣oi∣ρ~i,t)1/∣oi∣=1. \left( \prod_{t=1}^{|o_i|} \widetilde{\rho}_{i,t} \right)^

``

该归一化移除了对数重要性比率中的序列级均值偏移,同时保留了教师在不同 token 之间的相对偏好。

https://huggingface.co/papers/2607.17247#negative-sample-reset负样本重置

教师指导仅应用于正优势回答:

`` wi,t={ρ~i,t,Ai>0,1,Ai≤0. w_

\begin{cases} \widetilde{\rho}_{i,t}, & A_i > 0, \ 1, & A_i \leq 0. \end{cases} ``

对于负优势回答,更新退化为原始强化学习目标。

https://huggingface.co/papers/2607.17247#distilled-rl-objective蒸馏强化学习目标

对于从旧学生策略中采样的回答,最终的策略优化目标为

`` JDistilledRL(θ)=E[1G∑i=1G1∣oi∣∑t=1∣oi∣min⁡(ri,t(θ)wi,tAi,r^i,t(θ)wi,tAi)], \mathcal{J}_{\mathrm{DistilledRL}}(\theta)

\mathbb{E} \left[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \min \left( r_{i,t}(\theta) w_{i,t} A_i, \hat{r}{i,t}(\theta) w{i,t} A_i \right) \right], ``

其中裁剪后的策略比率为

`` r^i,t(θ)=clip(ri,t(θ),1−εlow,1+εhigh). \hat{r}_{i,t}(\theta)

\mathrm{clip} \left( r_{i,t}(\theta), 1-\epsilon_{\mathrm{low}}, 1+\epsilon_{\mathrm{high}} \right). ``

与基于 KL 的在线策略蒸馏不同,蒸馏强化学习并不将教师视为无条件的模仿目标。相反,教师在 token 级别上选择性地重新分配奖励驱动的策略梯度信号。

https://huggingface.co/papers/2607.17247#main-results主要结果

我们在三个学生模型上使用 Qwen3-8B-GRPO 作为教师来评估蒸馏强化学习。下表报告了十个数学推理基准的平均 Pass@1。

学生模型基础OPDRLOPD+RL蒸馏强化学习DeepSeek-R1-Distill-Qwen-1.5B31.7035.2736.8636.5440.00Qwen3-1.7B39.8645.2144.7644.8946.37Qwen3-4B46.3355.9757.4056.3858.96

在不同的学生规模和教师-学生设置下,蒸馏强化学习持续优于标准强化学习、OPD 及其直接组合。

https://huggingface.co/papers/2607.17247#requirements要求

https://huggingface.co/papers/2607.17247#software软件

克隆仓库:

git clone https://github.com/597358816/Distilled-RL.git cd Distilled-RL

安装所需依赖:

pip install torch==2.6.0 torchaudio==2.6.0 torchvision==0.21.0 vllm==0.8.3 transformers==4.51.2 pip install ray==2.48.0 tensordict==0.9.1 pydantic==2.11.7 pip install flash-attn pip install -e . pip install tensorboard cd examples bash XX.sh

相似文章

面向Lean定理证明的LLM反馈蒸馏

arXiv cs.AI

提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。

基于参考的LLM蒸馏检测

arXiv cs.LG

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏

Hugging Face Daily Papers

MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。