@neural_avb: 如果你对 On Policy Distillation 感兴趣,可以看看这个特定仓库。有人整理了一份精选合集…
摘要
针对 On Policy Distillation 的精选论文和工具合集,分类并注释,附有入门指南部分,通过 GitHub 仓库分享。
查看缓存全文
缓存时间: 2026/05/29 14:10
如果大家对“在线策略蒸馏”(On Policy Distillation)感兴趣,可以来看看这个专门的仓库。
有人整理了一份分类标注的论文与工具精选集,还附带了“快速上手”指南。https://t.co/nwVgFdoLDY
pradheep (@pradheepraop): 现在开始认真深入研究 opd/opsd(在线策略蒸馏/在线策略模仿学习)了。
感谢 @neural_avb 和 @chrisliu298 整理这些超实用的资源。
欢迎继续推荐 🙂
相似文章
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。
@neural_avb: 这篇文章实际上解释了On Policy Distillation损失函数的所有组成部分(前向与反向KL),等等…
本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
@louieworth: 新博客文章:On-Policy Distillation — 前景、陷阱与展望
这篇博客文章讨论了On-Policy Distillation (OPD),这是一种结合在线策略 rollout 与密集教师监督的技术,并重点介绍了其前景、三种失败模式以及作者关于该主题的新论文。
@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…
On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。