PathGuide:通过在线策略传输对齐的动态无分类器引导
摘要
PathGuide 将无分类器引导的选择重新表述为基于流的生成模型中的在线策略传输问题,利用连续性方程的弱形式动态优化引导尺度,以提高样本保真度。
arXiv:2608.29107v1 公告类型:新
摘要:虽然现代生成模型擅长建模复杂数据,但在条件生成中精确的推理时控制仍是一个关键挑战。无分类器引导(CFG)是此类控制的主要机制,但通常被视为静态调整参数。然而,在基于流的模型中,引导尺度从根本上决定了速度场和相应的概率路径,使得引导选择成为一个动态路径优化问题。我们引入 PathGuide,这是一个将标量 CFG 选择重新表述为在线策略传输问题的框架。利用连续性方程的弱形式,我们推导出一个具有直接路径正确性解释的选择标准:我们证明,如果引导场在生成滚动中弱等价于精确的条件场,则采样器的路径与目标条件定律一致。对于标量 CFG,该标准产生一个严格二次的局部目标,并为每个求解器区间提供高效的封闭形式选择器。PathGuide 使得最优引导尺度可以在生成过程中在线计算和使用,或离线拟合为可重复使用的分段常数调度。我们在低分辨率图像流形和各种连续时间流构建的受控设置中验证了该方法,表明这种基于传输的选择器在路径对齐和样本保真度方面优于固定和最先进的自适应引导基线。
查看缓存全文
缓存时间: 2026/09/01 13:08
# PathGuide:基于在线策略传输对齐的动态无分类器引导 来源:https://arxiv.org/html/2608.29107 Avishag Nevo††注:通讯作者邮箱 [email protected],Tamir Hazan 所属机构:以色列理工学院 | 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 现代生成模型虽擅长建模复杂数据,但在条件生成中实现精确的推理时控制仍是关键挑战。无分类器引导(CFG)是此类控制的主要机制,但通常被当作静态调优参数。而在基于流的模型中,引导尺度从根本上决定了速度场与生成的概率路径,因此引导选择本质上是一个动态路径优化问题。我们提出 *PathGuide* 框架,将标量 CFG 选择重新表述为在线策略传输问题。借助 *连续性方程的弱形式*,我们推导出具有直接路径正确性解释的选择准则:证明若引导场沿生成滚动过程与精确条件场弱等价,则采样器路径与目标条件律一致。对于标量 CFG,该准则产生严格二次的局部目标函数,并为每个求解区间提供高效闭式选择器。PathGuide 支持在生成过程中*在线*计算并使用最优引导尺度,或离线拟合为*可复用*的分段常数调度策略。我们在低分辨率图像流形及多种连续时间流构造的控制实验中验证该方法,证明这种基于传输的选择器能改善路径对齐与样本保真度,优于固定及自适应引导基线。 ## 1 引言 现代生成建模通过学习连续时间动力学,实现了在真实数据与生成数据分布间最小差异建模复杂数据分布的显著成功。这一范式下,基于分数的模型学习反向随机或概率流动力学,而基于流的模型通过速度场回归学习概率路径。条件生成建模已推动文本到图像合成、视频生成、音频合成、机器人与决策、生物分子建模及编辑、修复、空间运动约束等后训练控制任务的广泛应用。这些场景中推理时控制至关重要。一旦训练完成大规模生成器,通常通过无分类器引导(CFG)引导其满足条件,该方法依赖恒定尺度或手工调度策略。尽管能改善条件对齐,但关于生成样本分布的误解依然存在,暴露出深刻的路径不一致性:轨迹的不同区段常需要变化的引导强度。过度引导会降低多样性、引发模式坍塌并使样本偏离学习到的流形。因此,引导选择应被视为路径优化问题,而非简单超参数调优。现有方法通过启发式调整引导尺度、训练辅助网络进行路径修正或施加几何约束来抑制引导尺度与模型的错误交互。虽然有效,但这些方法未解决根本的传输问题:哪个标量 CFG 值能确保采样器实际滚动忠于精确条件概率路径。 我们引入 PathGuide,将标量 CFG 选择重构为在线策略传输问题。通过 *连续性方程弱形式* 推导出具有路径正确性解释的准则:若引导场沿生成滚动与精确条件场弱等价,则生成滚动与精确条件概率路径一致。基于该准则,我们提出适用于标量 CFG 家族的严格二次局部目标函数,并给出闭式最优引导尺度计算公式。PathGuide 实现采样过程中*在线*引导尺度适配与离线生成*可复用*分段常数调度策略,在基于流匹配的受控高斯混合流实验中,证明其路径对齐与端点保真度优于现有无训练基线。 ## 2 相关工作 流匹配与整流流的出现使生成建模范式从离散扩散步骤转向沿学习速度场的连续时间传输。现有研究利用边缘动力学分解为端点条件路径作为训练目标,我们重新利用该分解作为推理时诊断工具,评估引导速度场与真实传输律的局部一致性。确保一致性具有挑战性,因最优引导尺度非常量:扩散与流模型中不同生成轨迹区段对条件的敏感度各异。这催生了自适应、退火与反馈式调度器,但常缺乏形式化分布保证。我们从弱连续性方程直接推导变分准则,为引导调度提供第一性原理推导,无需手动调参或辅助训练。除调度引导尺度外,同期研究聚焦于"修复" CFG 更新本身以缓解模式坍塌等已知问题。这类流形感知修正与求解器级改进旨在优化更新*形式*,而我们的工作则优化该更新的标量*输入*。这种动态选择趋势反映了生成模型评估标准从终端样本转向诱导概率路径的整体对齐。我们进一步将引导选择视为在线策略传输问题,区别于现有基于理想路径的先验调度策略,PathGuide 直接在采样器实现滚动上优化引导尺度,确保轨迹忠于目标条件分布。
相似文章
重新思考策略内扩散蒸馏中的无分类器引导
本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。
基于信息论的无分类器引导与自适应调度优化
提出了一种基于信息论的框架,用于优化扩散模型中的无分类器引导调度,在ImageNet和COCO基准上实现了条件一致性与样本多样性之间更优的权衡。
面向组合奖励的流模型冲突感知加性引导
本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。
如何引导您的语言流
本文介绍了探针引导,一种用于连续扩散语言模型中流匹配模型的新方法,该方法在无条件生成上实现了最先进的性能,并提升了多项选择问答基准,同时提供了对自引导的见解。
基于对抗学习的无分类器指导调度
本文提出使用对抗学习来学习扩散模型的动态无分类器指导调度,通过调整指导尺度以适应不同状态,从而提升文本到图像生成质量。