通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers 论文

摘要

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

带有可验证奖励的强化学习(RLVR)是提升语言模型推理能力的强大方法,但由于目标模型在训练过程中必须生成大量轨迹,每次在新的强模型上重复此过程成本高昂。随着模型规模扩大,后训练本身成为瓶颈。我们研究了一种弱到强的替代方案:在轨迹成本较低的小模型上运行强化学习,然后重用该强化学习所学的成果来改进更强的目标模型。直接蒸馏后强化学习的弱教师模型是不够的,因为教师最终的策略混合了有用的强化学习收益和小模型的局限性。我们提出了直接在线策略蒸馏(Direct-OPD),该方法转而迁移教师模型由强化学习引起的策略变化。Direct-OPD将后强化学习的教师与其自身的预强化学习参考进行比较,并将其对数比值作为学生模型的稠密隐式奖励。简单来说,检查点对告诉我们强化学习使弱模型更有可能或更不可能采取哪些行动,而Direct-OPD则在更强的学生模型自己的在线策略状态上应用该信号。这直接重用了弱模型的强化学习监督信号,而无需在目标模型上运行稀疏奖励的强化学习。实验表明,Direct-OPD能够一致地利用较弱的教师模型来改进更强的目标模型;值得注意的是,在8块A100 GPU上仅用4小时,它就将Qwen3-1.7B在AIME 2024上的表现从48.3%提升到58.3%。它优于步骤匹配的直接强化学习,并支持多个策略变化的顺序组合。我们的结果表明,强化学习成果可以跨模型规模作为隐式奖励信号重用,而不仅仅是作为最终模型进行模仿。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:12

论文页面 - 通过直接在线策略蒸馏实现弱到强泛化

来源:https://huggingface.co/papers/2607.05394

RLVR 虽然强大,但为每个更大的目标模型重复执行成本高昂:每个目标必须生成自己的轨迹,并从稀疏的结果奖励中重新发现有用的学习信号。

在小型弱模型上运行 RL 能否提升更强的学生模型——即使学生模型在 RL 后已经超越了小模型?

我们发现可以——但并非通过蒸馏弱模型本身。

今天,我们很高兴分享 Direct-OPD,由 SIA-Lab 开发,这是清华大学智能产业研究院(AIR)与字节跳动 Seed 的联合实验室。 https://bytedtsinghua-sia.github.io/Direct-OPD/

我们的替代方案很简单:

  1. 在小型模型上运行 RL,探索和轨迹生成成本更低。
  2. 将模型的 RL 前后检查点视为教师对,其差异捕捉了通过 RL 学习到的方向。
  3. 使用更强学生模型自身的轨迹,在线蒸馏这一策略偏移——即 RL 改变的部分。

在 AIME24 的一个设置中: • 1.5B 教师对:RL 前和 RL 后检查点(RL 后的教师得分:51.3) • 7B 学生转移前:56.7 • 7B 学生 + 普通在线策略蒸馏:~50 • 7B 学生 + Direct-OPD:63.1(+6.4)

7B 学生模型在开始时已经比 RL 后的教师模型更强。蒸馏教师模型本身会使学生变差。但蒸馏教师对通过 RL 学到的策略偏移可以进一步提升。

换句话说,一次 RL 运行的可复用成果不仅是最终检查点——还可以是由 RL 前后检查点对编码的策略偏移。

相似文章

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。