@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…

X AI KOLs Timeline 论文

摘要

On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。

当前AI领域最热门的术语之一是"On-policy distillation"。 它是一种后训练技术,学生模型(通常是LLM)从其当前策略中采样,并为在策略状态接收教师信号。它结合了蒸馏的密集监督和在线RL的局部性。 现在PapersWithCode上已有该方法! 在这里查找所有引用它的183篇论文及更多:https://paperswithcode.co/methods/on-policy-distillation…
查看原文
查看缓存全文

缓存时间: 2026/05/25 14:56

目前 AI 领域最热门的术语之一就是“On-policy distillation”。

这是一种后训练技术,学生模型(通常是 LLM)从其当前策略中采样,并为在策略状态接收教师信号。它结合了蒸馏的密集监督和在线 RL 的局部性。

现在,PapersWithCode 上收录了该方法!查找所有引用它的 183 篇论文,以及更多内容:https://paperswithcode.co/methods/on-policy-distillation…

相似文章

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。