重新思考策略内扩散蒸馏中的无分类器引导
摘要
本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。
查看缓存全文
缓存时间: 2026/07/28 06:33
论文页面 - 重新思考在线策略扩散蒸馏中的无分类器引导
来源:https://huggingface.co/papers/2607.24731
当在线策略扩散蒸馏遇上无分类器引导时会发生什么?
一种自然的做法是让教师模型和学生模型的引导预测相匹配。但这个看似合理的目标却隐藏着微妙的歧义性:来自正负CFG分支的误差可能相互抵消,使得引导输出看起来正确,即使各个分支本身并不正确。
我们发现,当教师和学生使用相同的负条件时,这种歧义通常无害。然而,当教师在其负分支中保留特权信息时,两个分支在训练过程中可能开始朝相反方向移动。我们将这种失败模式称为负分支不对称性(NBA)。
我们的解决方案——正方向匹配(PDM)——分别监督正预测和CFG条件方向。这消除了跨分支误差补偿,使蒸馏后的模型对推理引导尺度的变化具有更强的鲁棒性。
我们在图像域诊断以及从密集到稀疏的视频控制(包括姿态、深度和涂鸦条件)上研究了这一行为。
我们希望这项工作提供了一个有用的视角:在蒸馏基于CFG的模型时,仅仅匹配最终的引导预测可能不够——分支本身也很重要。
相似文章
承诺先于实现:掩码扩散语言模型中无分类器引导何时不再必要
本文研究了在掩码扩散语言模型中,无分类器引导(CFG)在何种情况下真正必要。研究表明,对引导的依赖因提示而异,且通常可以在不损失约束满足能力的前提下移除引导,并由此定义了“承诺视界”(commitment horizon)。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
PathGuide:通过在线策略传输对齐的动态无分类器引导
PathGuide 将无分类器引导的选择重新表述为基于流的生成模型中的在线策略传输问题,利用连续性方程的弱形式动态优化引导尺度,以提高样本保真度。