@neural_avb: 这篇文章实际上解释了On Policy Distillation损失函数的所有组成部分(前向与反向KL),等等…

X AI KOLs Timeline 新闻

摘要

本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。

这篇文章实际上解释了On Policy Distillation的所有组成部分 损失函数(前向与反向KL)、监督粒度、特权类型以及特权优势估计这一概念。 我喜欢的其他OPD资源: Thinking Machines/反向KL: http://thinkingmachines.ai/blog/on-policy… TRL: http://huggingface.co/spaces/Hugging… wh: http://x.com/nrehiew_/statu… Will Brown: http://x.com/willccbb/statu…
查看原文
查看缓存全文

缓存时间: 2026/07/11 07:21

这篇文章实际上解释了在线策略蒸馏(On Policy Distillation)的所有组成部分:

损失函数(前向 vs 反向 KL)、监督粒度、特权类型,以及这种称为“特权优势估计”的概念。

我喜欢的其他在线策略蒸馏(OPD)资源:

Thinking Machines/反向 KL:http://thinkingmachines.ai/blog/on-policy…

TRL: http://huggingface.co/spaces/Hugging…

wh: http://x.com/nrehiew_/statu…

Will Brown: http://x.com/willccbb/statu…

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。