通过直接在线策略蒸馏实现弱到强泛化
摘要
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
查看缓存全文
缓存时间: 2026/07/14 04:12
论文页面 - 通过直接在线策略蒸馏实现弱到强泛化
来源:https://huggingface.co/papers/2607.05394
RLVR 虽然强大,但为每个更大的目标模型重复执行成本高昂:每个目标必须生成自己的轨迹,并从稀疏的结果奖励中重新发现有用的学习信号。
在小型弱模型上运行 RL 能否提升更强的学生模型——即使学生模型在 RL 后已经超越了小模型?
我们发现可以——但并非通过蒸馏弱模型本身。
今天,我们很高兴分享 Direct-OPD,由 SIA-Lab 开发,这是清华大学智能产业研究院(AIR)与字节跳动 Seed 的联合实验室。 https://bytedtsinghua-sia.github.io/Direct-OPD/
我们的替代方案很简单:
- 在小型模型上运行 RL,探索和轨迹生成成本更低。
- 将模型的 RL 前后检查点视为教师对,其差异捕捉了通过 RL 学习到的方向。
- 使用更强学生模型自身的轨迹,在线蒸馏这一策略偏移——即 RL 改变的部分。
在 AIME24 的一个设置中: • 1.5B 教师对:RL 前和 RL 后检查点(RL 后的教师得分:51.3) • 7B 学生转移前:56.7 • 7B 学生 + 普通在线策略蒸馏:~50 • 7B 学生 + Direct-OPD:63.1(+6.4)
7B 学生模型在开始时已经比 RL 后的教师模型更强。蒸馏教师模型本身会使学生变差。但蒸馏教师对通过 RL 学到的策略偏移可以进一步提升。
换句话说,一次 RL 运行的可复用成果不仅是最终检查点——还可以是由 RL 前后检查点对编码的策略偏移。
相似文章
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。