通过直接在线策略蒸馏实现弱到强泛化
摘要
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
查看缓存全文
缓存时间: 2026/07/14 04:12
论文页面 - 通过直接在线策略蒸馏实现弱到强泛化
来源:https://huggingface.co/papers/2607.05394
RLVR 虽然强大,但为每个更大的目标模型重复执行成本高昂:每个目标必须生成自己的轨迹,并从稀疏的结果奖励中重新发现有用的学习信号。
在小型弱模型上运行 RL 能否提升更强的学生模型——即使学生模型在 RL 后已经超越了小模型?
我们发现可以——但并非通过蒸馏弱模型本身。
今天,我们很高兴分享 Direct-OPD,由 SIA-Lab 开发,这是清华大学智能产业研究院(AIR)与字节跳动 Seed 的联合实验室。 https://bytedtsinghua-sia.github.io/Direct-OPD/
我们的替代方案很简单:
- 在小型模型上运行 RL,探索和轨迹生成成本更低。
- 将模型的 RL 前后检查点视为教师对,其差异捕捉了通过 RL 学习到的方向。
- 使用更强学生模型自身的轨迹,在线蒸馏这一策略偏移——即 RL 改变的部分。
在 AIME24 的一个设置中: • 1.5B 教师对:RL 前和 RL 后检查点(RL 后的教师得分:51.3) • 7B 学生转移前:56.7 • 7B 学生 + 普通在线策略蒸馏:~50 • 7B 学生 + Direct-OPD:63.1(+6.4)
7B 学生模型在开始时已经比 RL 后的教师模型更强。蒸馏教师模型本身会使学生变差。但蒸馏教师对通过 RL 学到的策略偏移可以进一步提升。
换句话说,一次 RL 运行的可复用成果不仅是最终检查点——还可以是由 RL 前后检查点对编码的策略偏移。
相似文章
利用在线策略逆蒸馏实现弱到强泛化
论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。
基于策略的蒸馏与离策略GRPO结合:训练紧凑指令遵循重排序器
本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
Weak-to-Strong On-Policy Distillation
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。