用于大语言模型后训练的蒸馏强化学习
摘要
介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - 面向 LLM 后训练的蒸馏强化学习
来源:https://huggingface.co/papers/2607.17247
https://huggingface.co/papers/2607.17247#distilled-reinforcement-learning-for-llm-post-training面向 LLM 后训练的蒸馏强化学习
arXiv (https://arxiv.org/abs/2607.17247)GitHub (https://github.com/597358816/Distilled-RL)
标准强化学习依赖粗粒度的结果奖励,而在线策略蒸馏通常无条件地鼓励学生模仿教师分布。相比之下,蒸馏强化学习利用教师在 token 级别重新分配策略梯度信号,在保留奖励驱动优化的同时提供选择性且细粒度的指导。
https://huggingface.co/papers/2607.17247#overview概述
distilled-RL-main (https://cdn-uploads.huggingface.co/production/uploads/67d139a2c37dc49c9b4427e1/oakRP-GudVK-lDj4z9YiI.png)
蒸馏强化学习包含三个组件:
- 反向重要性采样,衡量教师对每个学生生成 token 的相对偏好。
- 负样本重置,在负优势轨迹上禁用教师重新加权。
- 序列级几何归一化,移除序列级尺度偏差,同时保留相对 token 偏好。
https://huggingface.co/papers/2607.17247#method方法
给定提示 q 以及从旧学生策略中采样的回答 o\_i,标准策略比率为
`` ri,t(θ)=πθ(oi,t∣q,oi,1:t−1)πold(oi,t∣q,oi,1:t−1) r_{i,t}(\theta)
\frac{ \pi_{\theta}(o_{i,t} \mid q, o_{i,1:t-1}) }{ \pi_{\mathrm{old}}(o_{i,t} \mid q, o_{i,1:t-1}) } ``
回答级别的优势使用组归一化奖励进行估计:
`` Ai=Ri−mean({Rj}j=1G)std({Rj}j=1G). A_i
\frac{ R_i - \mathrm{mean}({R_j}{j=1}^{G}) }{ \mathrm{std}({R_j}{j=1}^{G}) }. ``
https://huggingface.co/papers/2607.17247#reverse-importance-sampling反向重要性采样
我们使用以下公式衡量教师对每个学生生成 token 的相对偏好:
`` ρi,t=πteacher(oi,t∣q,oi,1:t−1)πθold(oi,t∣q,oi,1:t−1). \rho_
\frac{ \pi_{\mathrm{teacher}}(o_{i,t} \mid q, o_{i,1:t-1}) }{ \pi_{\theta_{\mathrm{old}}}(o_{i,t} \mid q, o_{i,1:t-1}) }. ``
为防止极端的教师-学生似然比,我们应用对称裁剪:
`` ρˉi,t=clip(ρi,t,ερ−1,ερ). \bar{\rho}_
\mathrm{clip} \left( \rho_{i,t}, \epsilon_{\rho}^{-1}, \epsilon_{\rho} \right). ``
https://huggingface.co/papers/2607.17247#sequence-level-geometric-normalization序列级几何归一化
在每个回答内部对裁剪后的比率进行归一化:
`` ρ~i,t=ρˉi,texp(1∣oi∣∑s=1∣oi∣logρˉi,s). \widetilde{\rho}_
\frac{ \bar{\rho}{i,t} }{ \exp \left( \frac{1}{|o_i|} \sum{s=1}^{|o_i|} \log \bar{\rho}_{i,s} \right) }. ``
归一化后的比率满足
`` (∏t=1∣oi∣ρ~i,t)1/∣oi∣=1. \left( \prod_{t=1}^{|o_i|} \widetilde{\rho}_{i,t} \right)^
``
该归一化移除了对数重要性比率中的序列级均值偏移,同时保留了教师在不同 token 之间的相对偏好。
https://huggingface.co/papers/2607.17247#negative-sample-reset负样本重置
教师指导仅应用于正优势回答:
`` wi,t={ρ~i,t,Ai>0,1,Ai≤0. w_
\begin{cases} \widetilde{\rho}_{i,t}, & A_i > 0, \ 1, & A_i \leq 0. \end{cases} ``
对于负优势回答,更新退化为原始强化学习目标。
https://huggingface.co/papers/2607.17247#distilled-rl-objective蒸馏强化学习目标
对于从旧学生策略中采样的回答,最终的策略优化目标为
`` JDistilledRL(θ)=E[1G∑i=1G1∣oi∣∑t=1∣oi∣min(ri,t(θ)wi,tAi,r^i,t(θ)wi,tAi)], \mathcal{J}_{\mathrm{DistilledRL}}(\theta)
\mathbb{E} \left[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \min \left( r_{i,t}(\theta) w_{i,t} A_i, \hat{r}{i,t}(\theta) w{i,t} A_i \right) \right], ``
其中裁剪后的策略比率为
`` r^i,t(θ)=clip(ri,t(θ),1−εlow,1+εhigh). \hat{r}_{i,t}(\theta)
\mathrm{clip} \left( r_{i,t}(\theta), 1-\epsilon_{\mathrm{low}}, 1+\epsilon_{\mathrm{high}} \right). ``
与基于 KL 的在线策略蒸馏不同,蒸馏强化学习并不将教师视为无条件的模仿目标。相反,教师在 token 级别上选择性地重新分配奖励驱动的策略梯度信号。
https://huggingface.co/papers/2607.17247#main-results主要结果
我们在三个学生模型上使用 Qwen3-8B-GRPO 作为教师来评估蒸馏强化学习。下表报告了十个数学推理基准的平均 Pass@1。
学生模型基础OPDRLOPD+RL蒸馏强化学习DeepSeek-R1-Distill-Qwen-1.5B31.7035.2736.8636.5440.00Qwen3-1.7B39.8645.2144.7644.8946.37Qwen3-4B46.3355.9757.4056.3858.96
在不同的学生规模和教师-学生设置下,蒸馏强化学习持续优于标准强化学习、OPD 及其直接组合。
https://huggingface.co/papers/2607.17247#requirements要求
https://huggingface.co/papers/2607.17247#software软件
克隆仓库:
git clone https://github.com/597358816/Distilled-RL.git cd Distilled-RL
安装所需依赖:
pip install torch==2.6.0 torchaudio==2.6.0 torchvision==0.21.0 vllm==0.8.3 transformers==4.51.2 pip install ray==2.48.0 tensordict==0.9.1 pydantic==2.11.7 pip install flash-attn pip install -e . pip install tensorboard cd examples bash XX.sh
相似文章
面向Lean定理证明的LLM反馈蒸馏
提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。
基于参考的LLM蒸馏检测
本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。
MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏
MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。