On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning 论文

摘要

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

你好,我是Hugging Face开源团队的Niels。在[paperswithcode.co](http://paperswithcode.co),我正努力让人们更容易了解AI论文中使用的最新技术。我最近添加的AI研究中最热门术语之一是[On-policy distillation](https://paperswithcode.co/methods/on-policy-distillation),也简称为OPD。它是Qwen 3.6和3.7、GLM-5.1以及DeepSeek-V4等模型的关键后训练技术。 https://preview.redd.it/yegq2gfag95h1.png?width=3046&format=png&auto=webp&s=f68fdf3ca075f3c4e56051fdd0ebcf97be9bcbc9 在PapersWithCode上,你可以找到介绍它的原始论文,了解更多关于该方法本身的信息,以及所有引用或提及它的论文。 Sasha Rush(曾是我在Hugging Face的同事,现在在Cursor)最近与Dwarkesh一起制作了一个[精彩的白板讲解](https://x.com/dwarkesh_sp/status/2062353335529935114)关于OPD。我已经将这个视频讲座链接在了PwC网站的方法描述中,以便更多人能找到它。 我将从这里复制Dwarkesh对该方法的精彩简短描述: "基本思想是这样的:如果模型在rollout的某个点犯了一个错误(例如,调用了不存在的工具),我们希望抑制这个特定的错误,但我们不想仅仅从最终奖励中学习,因为那是一个分布在整条轨迹上的嘈杂信号。所以我们使用另一个模型来读取这条轨迹,并找出错误发生的位置。它只是在错误发生位置正上方的轨迹部分插入一些提示标记(hint tokens)。现在,有了这些注入的提示标记,对模型进行一次前向传播。你不需要重新生成新的rollout——即无需新的解码。提示使得模型为错误标记分配更低的概率。然后你训练原始模型来匹配这些新的概率,教会它降低那个特定错误的权重。" 请告诉我我还应该添加哪些其他方法!干杯
查看原文

相似文章

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。

论同策略蒸馏的几何结构

Hugging Face Daily Papers

本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。