On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
摘要
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
你好,我是Hugging Face开源团队的Niels。在[paperswithcode.co](http://paperswithcode.co),我正努力让人们更容易了解AI论文中使用的最新技术。我最近添加的AI研究中最热门术语之一是[On-policy distillation](https://paperswithcode.co/methods/on-policy-distillation),也简称为OPD。它是Qwen 3.6和3.7、GLM-5.1以及DeepSeek-V4等模型的关键后训练技术。
https://preview.redd.it/yegq2gfag95h1.png?width=3046&format=png&auto=webp&s=f68fdf3ca075f3c4e56051fdd0ebcf97be9bcbc9
在PapersWithCode上,你可以找到介绍它的原始论文,了解更多关于该方法本身的信息,以及所有引用或提及它的论文。
Sasha Rush(曾是我在Hugging Face的同事,现在在Cursor)最近与Dwarkesh一起制作了一个[精彩的白板讲解](https://x.com/dwarkesh_sp/status/2062353335529935114)关于OPD。我已经将这个视频讲座链接在了PwC网站的方法描述中,以便更多人能找到它。
我将从这里复制Dwarkesh对该方法的精彩简短描述:
"基本思想是这样的:如果模型在rollout的某个点犯了一个错误(例如,调用了不存在的工具),我们希望抑制这个特定的错误,但我们不想仅仅从最终奖励中学习,因为那是一个分布在整条轨迹上的嘈杂信号。所以我们使用另一个模型来读取这条轨迹,并找出错误发生的位置。它只是在错误发生位置正上方的轨迹部分插入一些提示标记(hint tokens)。现在,有了这些注入的提示标记,对模型进行一次前向传播。你不需要重新生成新的rollout——即无需新的解码。提示使得模型为错误标记分配更低的概率。然后你训练原始模型来匹配这些新的概率,教会它降低那个特定错误的权重。"
请告诉我我还应该添加哪些其他方法!干杯
相似文章
@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…
On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。
@louieworth: 新博客文章:On-Policy Distillation — 前景、陷阱与展望
这篇博客文章讨论了On-Policy Distillation (OPD),这是一种结合在线策略 rollout 与密集教师监督的技术,并重点介绍了其前景、三种失败模式以及作者关于该主题的新论文。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。
论同策略蒸馏的几何结构
本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。