标签
This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.
Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.
提出将反事实可恢复性作为在线策略蒸馏中基于结果的决策变量,表明基于可恢复性进行选择性监督的方法在 AIME 和 GPQA 基准测试上优于仅依赖散度的方法。
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。
提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。
PromptSD 是一种新颖的在线策略自蒸馏方法,其中教师仅通过一个可学习的软提示与学生不同,从而能够在不产生权重漂移的情况下吸收多任务知识。它在四个任务上匹配或超过完全微调,同时保留通用能力。
Bhavin Jawade 讨论了在线策略蒸馏在大语言模型训练中的几种失败模式,包括早期错误变得无法纠正、更强的教师反而更差、基于特权信息的条件化无法迁移,以及密集监督导致的思维崩溃。
BhavinJawade 调研了关于在线策略蒸馏及其变体失败模式的论文,列出了近期多篇 arXiv 论文,包括《The Many Faces of On-Policy Distillation》等。
ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
理想汽车的Mach-Mind-4-Flash是一个拥有3B活跃参数的35B MoE模型,通过使用统一的强化学习/在线策略蒸馏损失进行后训练优化,在多个基准测试中达到了匹配或超越100B参数模型的性能。
MAD-OPD通过多教师辩论机制打破单教师蒸馏天花板,使小模型在工具调用和代码生成任务上反超大型教师模型。
本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。