@furongh:RL 与蒸馏可能是一个伪二分法。一种后训练抽象:将 RL 视为监督的编译器。使用策略…

X AI KOLs Timeline 论文

摘要

本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。

RL 与蒸馏可能是一个伪二分法。 一种后训练抽象: 将 RL 作为监督的编译器。 使用策略优化来推导模型应该去哪里。将解决方案编译为稠密目标。让蒸馏来完成训练。 介绍 β-OPSD 🧵 https://t.co/Syb7CNud6C
查看原文
查看缓存全文

缓存时间: 2026/08/04 16:12

RL 与蒸馏可能是一个虚假的二分法。

一种后训练抽象: RL 作为监督的编译器。 用策略优化来推导模型应该去哪里。将解决方案编译为稠密目标。让蒸馏来完成训练。 引入 β-OPSD

1/ 同策略自蒸馏(OPSD)听起来是推理的理想选择: 模型探索自己的轨迹。一个特权教师监督它实际访问的状态。 但 vanilla OPSD 做出了一个激进的假设: 直接一步到位,完全逼近教师。 立刻。

这可能很脆弱。

2/ 我们的关键观察: Vanilla OPSD 其实已经处于策略优化之中:它正好是一个更广泛的 KL 正则化家族中 β=1 的点。 β 控制学生锚定到其参考策略的强度。 一个固定的配方变成了一个可控的连续谱。

3/

一行数学就能揭示其中的几何结构:

π*β ∝ πref^(1−1/β) · pteacher^(1/β) β → ∞:保持在参考策略附近。 β = 1:匹配教师。 目标不再仅仅是一个终点。

它是从学生到教师的一条路径。

4/

这改变了配方。

Vanilla OPSD 要求学生瞬移到教师分布。

β-OPSD 让学生走过去。

我们对参考策略和教师的 logits 进行插值,然后逐渐增加教师的影响力:

一个关于分布的课程,而不是关于样本的课程。

5/

这里是我觉得最有趣的部分:

一旦策略优化告诉我们最优目标应该是什么,我们就不需要直接优化 RL 目标。 我们蒸馏向它的可处理近似。

策略优化指明了去哪里。 蒸馏提供了一种稳定且廉价的方式到达那里。

6/

蒸馏内部还隐藏着一个信用分配问题。

一个早期的推理 token 会改变后面的每一个前缀。然而标准 OPSD 只根据它与教师当前的即时不匹配来评判它。

这是短视的。

β-OPSD 用剩余回报将未来的不匹配向后传播。

7/

这种脆弱性在数字中可见。

Qwen3-1.7B,AIME 2024 avg@12:

Base:50.0 Vanilla OPSD:44.2 β-OPSD:53.3,比 Vanilla OPSD 提升 9.16 个百分点

在 AIME24、AIME25 和 HMMT25 上,β-OPSD 比 vanilla OPSD 平均提升 +5.74 分,并且平均表现优于 GRPO。

8/

在消融实验中,两个部分都很重要。

更平滑的目标使 AIME24/25 和 HMMT25 分别提升 +6.03/+5.30/+1.67 分。 用剩余回报取代局部 token 信用,额外增加 +1.12/+5.55/+3.61 分。

目标路径与面向未来的信用分配是互补的。

9/

这里的启示不是“蒸馏优于 RL”。

我们可能是在围绕错误的二分法来组织后训练。

RL 给了我们目标、几何结构和信用分配。 蒸馏给了我们稠密监督和稳定优化。

下一波浪潮可能有意识地组合两者。

10/

并非每个 RL 目标都会有闭式解。

但每当它的最优策略可以被刻画——或近似——时,我们都应该问:

我们能否蒸馏出解决方案,而不是直接优化目标?

我怀疑这种模式将远远超出 OPSD 的范畴。

11/

配方:

策略目标 → 目标分布 → 稠密监督 → 稳定训练。

用策略优化推导。 用自蒸馏训练。 https://arxiv.org/abs/2607.28582

与 @JimmyXu147587、@minghuiliu95、@juzheng_z 和 @tomgoldsteincs 合作完成。

相似文章

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。