CAT-Flow: 用于流匹配的曲率自适应步长

arXiv cs.LG 论文

摘要

本文提出了CAT-OV和CAT-OT两种轻量级、无需训练的算法,它们基于曲率自适应调整流匹配采样中的步长,提升图像质量并将生成步数最多减少40%。

arXiv:2609.01746v1 公告类型:新 摘要:流匹配已成为生成建模的领先框架,为FLUX和Stable Diffusion 3.5等最先进系统提供支持。然而,其基于ODE的采样过程的迭代性质造成了基本的效率瓶颈:生成样本的质量对步长选择高度敏感,当前模型通常需要20到30步才能获得良好质量。在这项工作中,我们提出两种轻量级、无需训练的算法CAT-OV和CAT-OT,它们在推理时基于流匹配采样与梯度流之间的一种新颖联系自适应调整步长。我们的算法计算高效,不需要额外的神经函数评估。具体来说,CAT-OT通过时间导数向量场的有限差分近似随时间估计曲率,而CAT-OV通过向量场的梯度近似状态空间上的曲率。在适当条件下,两种方法都具有常数阶的截断误差界。实证表明,CAT-OV和CAT-OT在四个文本到图像流匹配模型中,在图像质量指标上优于现有的步长启发式方法,将达到可比质量所需的生成步数最多减少40%。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:10

# 流匹配的曲率自适应步长  
来源:https://arxiv.org/html/2609.01746  
Qinchan (Wing) Li  
Pedro Cisneros-Velarde  
隶属:VMware Research  
隶属:通讯作者。第一作者。  
Keru Fu  
隶属:西蒙弗雷泽大学  
Samuel Antunes Miranda  
隶属:西蒙弗雷泽大学  
Sharan Vaswani  
Hao Zhang  
隶属:西蒙弗雷泽大学  

###### 摘要  
流匹配已成为生成建模的领先框架,为FLUX和Stable Diffusion 3.5等最先进的系统提供支持。然而,其基于常微分方程(ODE)的迭代采样过程造成了根本性的效率瓶颈:生成样本的质量对步长的选择高度敏感,当前模型通常需要20到30步才能获得良好质量。在这项工作中,我们提出了两种轻量级、无需训练的算法——CAT-OV和CAT-OT,它们基于流匹配采样与梯度流之间新颖的联系,在推理时自适应调整步长。我们的算法通过避免额外的神经函数评估来高效计算。具体而言,CAT-OT通过向量场时间导数的有限差分近似来估计随时间变化的曲率,而CAT-OV则通过向量场的梯度来近似状态空间上的曲率。在适当条件下,两种方法都具有常数阶的截断误差界。实证表明,在四个文本到图像的流匹配模型中,CAT-OV和CAT-OT在图像质量指标上优于现有的步长启发式方法,将生成达到可比质量所需的步数减少了高达40%。  

00脚注:\{qinchan\_li, keru\_fu, saa159, sharan\_vaswani, haoz\}@sfu.ca  
00脚注:[email protected]  

图例引用(a)男性亚瑟王和他的松鼠妻子,照片,戴王冠的男人  
图例引用(b)米开朗基罗的大卫雕像坐在一张有许多筹码的扑克桌旁  
图例引用(c)拍摄的一张史诗般、错综复杂、精致风化的机动人偶照片,由维塔工作室创造的生物  
图例引用(d)约翰·豪绘制的机场渲染图,清晨阳光下的花朵、被自然回收的CGSociety日落红外夜视湖泊热成像玻璃制成的薄雾  

图 1:使用我们的方法CAT-OV("我们的")进行文本提示的流匹配图像生成,用于选择步长,对比使用Diffusers库默认("默认")启发式方法的FLUX。文本提示来自DiffDB数据集(Wang et al., 2023 (https://arxiv.org/html/2609.01746#bib.bib17))。对于每种方法和每个提示,我们用绿色方框突出显示图像视觉质量停止改善的步骤。用红色圆圈标出的区域在生成的图像中显示出可观察到的伪影。  

## 1 引言  
流匹配(Lipman et al., 2023 (https://arxiv.org/html/2609.01746#bib.bib38); Liu et al., 2023 (https://arxiv.org/html/2609.01746#bib.bib39))是生成建模最突出的框架之一,为FLUX(Labs et al., 2025 (https://arxiv.org/html/2609.01746#bib.bib34))和Stable Diffusion 3.5(Esser et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib33))等最先进的文本到图像系统提供支持,并在包括音频(Xu et al., 2025 (https://arxiv.org/html/2609.01746#bib.bib35))和3D生成(Voleti et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib30))在内的多种模态中得到应用。其核心是,流匹配通过数值求解一个常微分方程(ODE)来生成样本,迭代地将噪声传输到目标数据分布。然而,这是有代价的:生成样本的质量对积分区间如何离散化(即步长的选择)高度敏感。实际上,步长的设计是推理效率的核心瓶颈:步数太少会导致大的离散化误差和样本质量下降,而步数太多则计算上不可行。为流匹配生成确定合适的步长一直是一个活跃的研究领域。最简单的方法基于欧拉离散化,使用固定的、均匀的步长,这种方法简单直接,但忽略了ODE轨迹在不同时间步长上变化的难度。启发式方法,如Hugging Face Diffusers库中的动态偏移(Esser et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib33)),通过使用单调递增的步长部分地解决了这个问题。此外,一些工作使用额外的神经网络来学习步长调度(Chen et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib3); Li et al., 2025b (https://arxiv.org/html/2609.01746#bib.bib4); Hu et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib7)),代价是额外的训练和潜在的领域过拟合。或者,经典的自适应ODE求解器如Dopri5(Hairer et al., 1993 (https://arxiv.org/html/2609.01746#bib.bib25))和最近针对流的变体(Jolicoeur-Martineau et al., 2021 (https://arxiv.org/html/2609.01746#bib.bib1); Fang et al., 2026 (https://arxiv.org/html/2609.01746#bib.bib11))在推理时调整步长,但每一步都需要多个神经函数评估,这对于数十亿参数模型来说尤其昂贵。最后,跳步方法(Bajpai et al., 2026 (https://arxiv.org/html/2609.01746#bib.bib2))提供的适应程度有限,因为它们只能从预定义的离散选项集中选择步长。  

我们的关键观察是,上述方法在确定步长时都没有直接考虑ODE轨迹景观的*几何*特性。我们的几何直觉是,轨迹中高度弯曲的区域需要小步长以保持足够的精度,而较平坦的区域可以使用大步长有效穿越。这正是优化中*自适应步长*的动机,例如Adam(Kingma and Ba, 2014 (https://arxiv.org/html/2609.01746#bib.bib22))和RMSProp(Hinton et al., 2012 (https://arxiv.org/html/2609.01746#bib.bib23))。至关重要的是,我们表明流匹配生成可以被重新表述为*梯度流*,从而建立了一个正式的桥梁来证明借用这种直觉的合理性。因此,受优化中的自适应方法与流匹配之间这种联系的启发,我们提出了两种*轻量级*且*无需训练*的流匹配ODE求解器:*基于时间的曲率感知时间步*(CAT-OT)和*基于值的曲率感知时间步*(CAT-OV)。它们在推理时使用生成过程中已有的关于向量场变化的信息来调整步长,不需要额外的神经函数评估。具体而言,CAT-OT通过向量场时间导数的有限差分近似来估计随时间变化的曲率,而CAT-OV则通过向量场的方差来估计所有过去值上的曲率。在适当条件下,两种方法都保证具有常数阶的截断误差界。我们的主要贡献总结如下:  

- • 我们展示了流匹配(在直线下)与梯度流之间的正式联系:如果它们共享相同的初始条件,则它们具有相同的解。  
- • 基于上述联系,我们提出了两种用于流匹配采样的自适应步长方法:CAT-OT和CAT-OV。它们分别利用沿时间和历史值整合的曲率信息,并通过高效的近似实现,无需额外的神经函数评估或训练。  
- • 我们证明了我们的方法在效率上优于多种基线:我们的方法可以用更少的步骤——或者在我们的情况下等效地,更少的神经函数评估(NFE)——达到基线方法用更多步骤才能达到的图像质量分数。这仅带来可忽略不计的挂钟时间和额外FLOPs。  
- • 我们证明了我们的方法在相似步数的情况下在图像质量分数上优于基线,并且在步数较少时性能提升更为显著。  

所有实验均使用一组多样化的现实世界用户提示(DiffDB(Wang et al., 2023 (https://arxiv.org/html/2609.01746#bib.bib17)))和三个互补的质量指标进行:提示对齐度(CLIP)、美学质量(AES)和人类偏好(HPSv3)——后两者是图像质量指标。我们希望我们方法的高效性能证明了流匹配与梯度流之间的联系可以为采样算法的设计提供一个良好的参考。  

## 2 相关工作  

##### 流匹配  
流匹配(Lipman et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib6))因其在各种模态(Esser et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib33); Labs et al., 2025 (https://arxiv.org/html/2609.01746#bib.bib34); Xu et al., 2025 (https://arxiv.org/html/2609.01746#bib.bib35); Karimi Monsefi et al., 2025 (https://arxiv.org/html/2609.01746#bib.bib36))的内容生成中实现高保真度而广受欢迎。它可以被理解为通过一个ODE描述随时间在两个概率分布之间的概率路径或传输。有趣的是,Vuong et al. (2025) (https://arxiv.org/html/2609.01746#bib.bib5)认为,扩散模型(一种基于随机路径的生成模型)的*训练*可以被解释为训练一个推广到Wasserstein空间(Santambrogio, 2017 (https://arxiv.org/html/2609.01746#bib.bib21))的流匹配模型,其向量场是梯度流。在我们的工作中,我们专注于标准的流匹配,并证明其*推理*可以等效于欧几里得空间上的梯度流。  

##### 流匹配中的曲率  
流匹配ODE描述的解路径理想情况下是*直线*,然而,神经模型对训练后的向量场的近似引入了曲率。Khan (2026) (https://arxiv.org/html/2609.01746#bib.bib8); Luo et al. (2025) (https://arxiv.org/html/2609.01746#bib.bib9); Lee et al. (2023) (https://arxiv.org/html/2609.01746#bib.bib10); Nguyen et al. (2023) (https://arxiv.org/html/2609.01746#bib.bib14)提出使用具有曲率感知能力的方法训练流匹配模型,以便训练后的向量场近似可以更直,从而实现更快的少步采样。在推理时,Luo et al. (2026) (https://arxiv.org/html/2609.01746#bib.bib12); Ma et al. (2025a) (https://arxiv.org/html/2609.01746#bib.bib13)通过减少使用过去或未来估计的近似曲率来平滑神经网络预测的向量场。Lu et al. (2025) (https://arxiv.org/html/2609.01746#bib.bib15)提出一种二阶求解器,将曲率近似纳入更新中,并提供了误差界。然而,这些工作都没有考虑使用曲率信息来解决步长问题。  

##### 扩散和流匹配的自适应生成  
Chen et al. (2024) (https://arxiv.org/html/2609.01746#bib.bib3); Hu et al. (2024) (https://arxiv.org/html/2609.01746#bib.bib7); Li et al. (2025b) (https://arxiv.org/html/2609.01746#bib.bib4)训练一个额外的神经模型,以实现生成过程的自适应步长或步数。这类工作面临着(i)需要额外训练,以及(ii)这种训练可能导致自适应过程特定于领域并可能过拟合训练数据集的问题。另一方面,(Fang et al., 2026 (https://arxiv.org/html/2609.01746#bib.bib11); Jolicoeur-Martineau et al., 2021 (https://arxiv.org/html/2609.01746#bib.bib1))和自适应ODE求解器——如Dopri5(Hairer et al., 1993 (https://arxiv.org/html/2609.01746#bib.bib25))和自适应Heun——通过查看不同步长下的未来速度预测来调整每一步的步长,直到其中一个满足特定标准。这种方法可能需要多个额外的神经函数评估——这些评估在具有数十亿参数的大型模型中是计算瓶颈。Bajpai et al. (2026) (https://arxiv.org/html/2609.01746#bib.bib2)使用赌博机在每一步使用固定选项集搜索跳过多少步。  

## 3 预备知识  
基于流的生成过程离散化一个随机微分方程(SDE)(Song et al., 2021 (https://arxiv.org/html/2609.01746#bib.bib37))或一个将样本从初始分布ρ₀传输到目标分布ρᵀ的ODE。目标是在给定初始时间t=0时X₀∼ρ₀的情况下,在最终时间t=T时获得Xᵀ∼ρᵀ。生成的SDE被描述为伊藤过程dXₜ = μ dt + σ dWₜ,其中μ是漂移系数,σ是扩散系数,dWₜ是标准维纳过程。生成的ODE是传输过程dXₜ = μ dt(无随机性),其中μ是向量场。在两种情况下,Xₜ都是t>0时分布的随机变量——即使生成过程是ODE,Xₜ也是随机的,因为X₀是随机的。按照惯例,我们取T=1。  

##### 流匹配  
考虑生成的ODE过程,最优流或整流流的μ = X₁ - X₀,通过*直线*连接两个样本X₀∼ρ₀和X₁∼ρ₁(Lipman et al., 2023 (https://arxiv.org/html/2609.01746#bib.bib38); Hu et al., 2024 (https://arxiv.org/html/2609.01746#bib.bib7))。那么,dXₜ/dt = X₁ - X₀  。(1)给定初始条件X₀,方程(1)的解是线性插值Xₜ = tX₁ + (1 - t)X₀。  

在实践中,我们通过训练某个模型,例如一个神经函数,(x, t) ↦ u(x, t; θ),由某个向量θ参数化,来近似μ。训练使用来自目标分布ρ₁的样本,即*真实数据*分布。然后,使用欧拉离散化从dXₜ/dt = u(Xₜ, t; θ)的解中计算样本,从t=0时的X₀开始。具体而言,给定区间[0,1]的离散化(tₖ)ₖ≥₀,其中t₀=0,欧拉离散化为 x_{t_{k+1}} = x_{t_k} + Δt_k · u(x_{t_k}, t_k; θ),  (2)其中生成质量与效率之间的平衡取决于步长Δt_k := t_{k+1} - t_k。  

##### 梯度流  
考虑一个*损失*或*势*函数y ↦ L(y)。一个相关的*梯度流*是以下形式的ODE:  
dyₜ/dt = -λ(t) ∇_{yₜ} L(yₜ),  (3)其中λ(t) > 0,对于ODE有定义的每个t,我们使用符号∇_{yₜ} L(yₜ) := ∇_y L(y) |_{y=yₜ}表示在yₜ处求值的L的梯度。值得注意的是,梯度流可以推广到欧几里得空间以外的空间,例如Wasserstein空间(Santambrogio, 2017 (https://arxiv.org/html/2609.01746#bib.bib21))。  

##### 自适应步长优化  
经验上,存在一些优化器通过使用自适应步长比梯度下降收敛更快,例如Adam(Kingma and Ba, 2014 (https://arxiv.org/html/2609.01746#bib.bib22))和RMSProp(Hinton et al., 2012 (https://arxiv.org/html/2609.01746#bib.bib23))。特别是,RMSProp及类似算法的形式为

相似文章

几何感知的图像流匹配

Hugging Face Daily Papers

本文提出用于自然图像的几何感知流匹配方法,将图像视为超球面上的点,并提出了SOT-CFM和SFM方法,通过利用图像数据的球面结构来改进生成建模。

Energy-Guided Flow Matching

Hugging Face Daily Papers

能量引导流匹配通过使用移动端点和自适应调度改进生成图像质量,以降低的训练成本达到最先进FID分数。

感知流匹配用于少步生成建模

Hugging Face Daily Papers

感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。