@neural_avb: 这篇文章实际上解释了On Policy Distillation损失函数的所有组成部分(前向与反向KL),等等…
摘要
本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。
查看缓存全文
缓存时间: 2026/07/11 07:21
这篇文章实际上解释了在线策略蒸馏(On Policy Distillation)的所有组成部分:
损失函数(前向 vs 反向 KL)、监督粒度、特权类型,以及这种称为“特权优势估计”的概念。
我喜欢的其他在线策略蒸馏(OPD)资源:
Thinking Machines/反向 KL:http://thinkingmachines.ai/blog/on-policy…
TRL: http://huggingface.co/spaces/Hugging…
wh: http://x.com/nrehiew_/statu…
Will Brown: http://x.com/willccbb/statu…
相似文章
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
@neural_avb: 如果你对 On Policy Distillation 感兴趣,可以看看这个特定仓库。有人整理了一份精选合集…
针对 On Policy Distillation 的精选论文和工具合集,分类并注释,附有入门指南部分,通过 GitHub 仓库分享。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。