@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…
摘要
On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。
查看缓存全文
缓存时间: 2026/05/25 14:56
目前 AI 领域最热门的术语之一就是“On-policy distillation”。
这是一种后训练技术,学生模型(通常是 LLM)从其当前策略中采样,并为在策略状态接收教师信号。它结合了蒸馏的密集监督和在线 RL 的局部性。
现在,PapersWithCode 上收录了该方法!查找所有引用它的 183 篇论文,以及更多内容:https://paperswithcode.co/methods/on-policy-distillation…
相似文章
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。