重新思考策略内扩散蒸馏中的无分类器引导
摘要
本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。
查看缓存全文
缓存时间: 2026/07/28 06:33
论文页面 - 重新思考在线策略扩散蒸馏中的无分类器引导
来源:https://huggingface.co/papers/2607.24731
当在线策略扩散蒸馏遇上无分类器引导时会发生什么?
一种自然的做法是让教师模型和学生模型的引导预测相匹配。但这个看似合理的目标却隐藏着微妙的歧义性:来自正负CFG分支的误差可能相互抵消,使得引导输出看起来正确,即使各个分支本身并不正确。
我们发现,当教师和学生使用相同的负条件时,这种歧义通常无害。然而,当教师在其负分支中保留特权信息时,两个分支在训练过程中可能开始朝相反方向移动。我们将这种失败模式称为负分支不对称性(NBA)。
我们的解决方案——正方向匹配(PDM)——分别监督正预测和CFG条件方向。这消除了跨分支误差补偿,使蒸馏后的模型对推理引导尺度的变化具有更强的鲁棒性。
我们在图像域诊断以及从密集到稀疏的视频控制(包括姿态、深度和涂鸦条件)上研究了这一行为。
我们希望这项工作提供了一个有用的视角:在蒸馏基于CFG的模型时,仅仅匹配最终的引导预测可能不够——分支本身也很重要。
相似文章
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。