@natolambert: 为新书增加的新讲座!名义上是关于合成数据,但主要是对蒸馏文献的回顾,从……
摘要
Natolambert 宣布了一场新讲座,内容涵盖合成数据和蒸馏的历史,从 Hinton 2015 年的论文到现代的 on-policy 蒸馏,视频总时长超过 7 小时。
查看缓存全文
缓存时间: 2026/06/23 16:12
新书讲座上线了!名义上是讲合成数据,但实际上更像是一次知识蒸馏文献的梳理——从Hinton 2015年的论文,一直讲到如今的多教师同策略蒸馏。
视频总长7.4小时,是我关于后训练思考的干货合集,而且还在不断增加中 :)
盯着数学公式看了足够久,梳理出从原始公式到如今主流的同策略蒸馏(以及RL框架)所需的3-4个核心改动,这个过程很有趣。
此外,我还穿插了一段历史课,讲合成数据如何逐步占领所有后训练数据研究(它并非一直如此)!然后做了一些入门级介绍,涉及宪法AI、评分准则和其他流行方法。
00:00 合成数据的兴起
10:50 师生知识蒸馏背景
24:47 同策略蒸馏(OPD、MOPD、OPSD)
37:11 宪法AI与AI反馈
45:50 作为奖励的评分准则及总结
当然,可以在YouTube等平台观看。
相似文章
@natolambert: 又一场快速讲座——很多人多次问过我关于我书籍的前置知识和应该了解的内容,所以我制作了一个小讲座…
Nathan Lambert 分享了一段视频讲座,涵盖了他书籍的前置知识,包括语言模型基础、概率和训练流程,使用 GLM 5.2 进行讲解。
@ben_burtenshaw: 在模型蒸馏被视为攻击向量之前,它确实是提升特定任务模型性能的实用方法……
Ben Burtenshaw 宣布将于7月7日进行一场直播,内容涵盖后训练中的知识蒸馏,演示如何使用小型模型实现接近大型模型的性能。
@huggingface:训练智能体2:关于模型蒸馏用于训练自定义智能体的直播教程。
Hugging Face举办了一场关于模型蒸馏用于训练自定义智能体的直播教程,现已提供回放。
@natolambert: 新播客与@finbarrtimbers!我们盘点最新的后训练配方,从GLM 5.1、Kimi K2.6、DeepSeek V4、Xia…
Nathan Lambert和Finbarr Timbers讨论了大型语言模型的最新后训练配方,包括DeepSeek V4、GLM 5.1、Kimi K2.6,以及行业向多教师在线策略蒸馏的转变。
@BhavinJawade:我正在调研探讨和解释在线策略蒸馏及其变体失败模式的论文。
BhavinJawade 调研了关于在线策略蒸馏及其变体失败模式的论文,列出了近期多篇 arXiv 论文,包括《The Many Faces of On-Policy Distillation》等。