重新思考策略内扩散蒸馏中的无分类器引导

Hugging Face Daily Papers 论文

摘要

本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。

策略内蒸馏(OPD)通过沿当前学生生成的轨迹查询教师来适配扩散模型,但它在无分类器引导(CFG)下的行为——现代扩散系统的默认组件——仍然知之甚少。现有的OPD方法自然地将速度匹配扩展到CFG组合预测,直接匹配教师和学生的引导速度。我们表明,这个目标在分支级别上是不明确的:正分支和负分支的错误可以在引导预测中相互补偿。通过两个对比案例,我们发现,在共享负条件的情况下,朴素匹配仍然有效,其中两个分支的错误共同减少。然而,当模型的原生CFG模式在教师的负分支中保留了学生无法获得的特权信息时,这种共同减少就会崩溃,组合目标会引发对抗性的分支错误动态,减少正分支错误的同时增加负分支错误。我们将这种失败模式称为负分支不对称性(NBA)。为了解决NBA,我们引入了正方向匹配(PDM),这是一种分支感知的OPD目标,分别约束正预测和CFG条件方向。我们将PDM应用于密集到稀疏视频控制,其中朴素的引导匹配对推理引导尺度高度敏感,而分支感知的监督能够实现更鲁棒和有效的知识迁移。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - 重新思考在线策略扩散蒸馏中的无分类器引导

来源:https://huggingface.co/papers/2607.24731

当在线策略扩散蒸馏遇上无分类器引导时会发生什么?

一种自然的做法是让教师模型和学生模型的引导预测相匹配。但这个看似合理的目标却隐藏着微妙的歧义性:来自正负CFG分支的误差可能相互抵消,使得引导输出看起来正确,即使各个分支本身并不正确。

我们发现,当教师和学生使用相同的负条件时,这种歧义通常无害。然而,当教师在其负分支中保留特权信息时,两个分支在训练过程中可能开始朝相反方向移动。我们将这种失败模式称为负分支不对称性(NBA)

我们的解决方案——正方向匹配(PDM)——分别监督正预测和CFG条件方向。这消除了跨分支误差补偿,使蒸馏后的模型对推理引导尺度的变化具有更强的鲁棒性。

我们在图像域诊断以及从密集到稀疏的视频控制(包括姿态、深度和涂鸦条件)上研究了这一行为。

我们希望这项工作提供了一个有用的视角:在蒸馏基于CFG的模型时,仅仅匹配最终的引导预测可能不够——分支本身也很重要。

相似文章

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。