@furongh:RL 与蒸馏可能是一个伪二分法。一种后训练抽象:将 RL 视为监督的编译器。使用策略…
摘要
本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。
查看缓存全文
缓存时间: 2026/08/04 16:12
RL 与蒸馏可能是一个虚假的二分法。
一种后训练抽象: RL 作为监督的编译器。 用策略优化来推导模型应该去哪里。将解决方案编译为稠密目标。让蒸馏来完成训练。 引入 β-OPSD
1/ 同策略自蒸馏(OPSD)听起来是推理的理想选择: 模型探索自己的轨迹。一个特权教师监督它实际访问的状态。 但 vanilla OPSD 做出了一个激进的假设: 直接一步到位,完全逼近教师。 立刻。
这可能很脆弱。
2/ 我们的关键观察: Vanilla OPSD 其实已经处于策略优化之中:它正好是一个更广泛的 KL 正则化家族中 β=1 的点。 β 控制学生锚定到其参考策略的强度。 一个固定的配方变成了一个可控的连续谱。
3/
一行数学就能揭示其中的几何结构:
π*β ∝ πref^(1−1/β) · pteacher^(1/β) β → ∞:保持在参考策略附近。 β = 1:匹配教师。 目标不再仅仅是一个终点。
它是从学生到教师的一条路径。
4/
这改变了配方。
Vanilla OPSD 要求学生瞬移到教师分布。
β-OPSD 让学生走过去。
我们对参考策略和教师的 logits 进行插值,然后逐渐增加教师的影响力:
一个关于分布的课程,而不是关于样本的课程。
5/
这里是我觉得最有趣的部分:
一旦策略优化告诉我们最优目标应该是什么,我们就不需要直接优化 RL 目标。 我们蒸馏向它的可处理近似。
策略优化指明了去哪里。 蒸馏提供了一种稳定且廉价的方式到达那里。
6/
蒸馏内部还隐藏着一个信用分配问题。
一个早期的推理 token 会改变后面的每一个前缀。然而标准 OPSD 只根据它与教师当前的即时不匹配来评判它。
这是短视的。
β-OPSD 用剩余回报将未来的不匹配向后传播。
7/
这种脆弱性在数字中可见。
Qwen3-1.7B,AIME 2024 avg@12:
Base:50.0 Vanilla OPSD:44.2 β-OPSD:53.3,比 Vanilla OPSD 提升 9.16 个百分点
在 AIME24、AIME25 和 HMMT25 上,β-OPSD 比 vanilla OPSD 平均提升 +5.74 分,并且平均表现优于 GRPO。
8/
在消融实验中,两个部分都很重要。
更平滑的目标使 AIME24/25 和 HMMT25 分别提升 +6.03/+5.30/+1.67 分。 用剩余回报取代局部 token 信用,额外增加 +1.12/+5.55/+3.61 分。
目标路径与面向未来的信用分配是互补的。
9/
这里的启示不是“蒸馏优于 RL”。
我们可能是在围绕错误的二分法来组织后训练。
RL 给了我们目标、几何结构和信用分配。 蒸馏给了我们稠密监督和稳定优化。
下一波浪潮可能有意识地组合两者。
10/
并非每个 RL 目标都会有闭式解。
但每当它的最优策略可以被刻画——或近似——时,我们都应该问:
我们能否蒸馏出解决方案,而不是直接优化目标?
我怀疑这种模式将远远超出 OPSD 的范畴。
11/
配方:
策略目标 → 目标分布 → 稠密监督 → 稳定训练。
用策略优化推导。 用自蒸馏训练。 https://arxiv.org/abs/2607.28582
与 @JimmyXu147587、@minghuiliu95、@juzheng_z 和 @tomgoldsteincs 合作完成。
相似文章
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
让数据决定:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由
本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。
@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…
On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。