ResilPhase:即插即用的相位映射与抗噪宏轨迹外推,用于扩散加速

arXiv cs.AI 论文

摘要

ResilPhase是一个免训练的扩散模型加速框架,将加速推理重述为ODE空间中的稳定宏轨迹外推,通过无导数重心拉格朗日外推和有界相位映射,在高加速比下实现最先进的保真度。

arXiv:2606.26769v1 公告类型:新 摘要:强大的扩散模型因其显著的推理延迟而难以广泛采用。最近的 ``缓存然后预测'' 方案通过使用基于导数的多项式加速DiT来缓解此问题,但在高加速比下会遭受严重的质量下降。我们的分析揭示了其根本原因:对与连续扩散轨迹未对齐且数值不稳定的表示进行离散外推。因此,加速的DiT会累积空间误差、噪声导数放大和高阶不稳定性。因此,我们将加速推理重新表述为常微分方程(ODE)空间中的稳定宏轨迹外推。我们不再预测中间特征,而是将预测与模型的全局漂移(GD)对齐,即端到端的状态演化,从而消除特征不一致性和内存开销。然而,即使这种平滑的宏轨迹仍然容易受到导数谬误的影响:其高阶时间导数本质上是嘈杂的。因此,我们引入了一种无导数重心拉格朗日外推器,以有效规避导数不稳定性和近似误差。我们进一步提出了一个有界相位映射,用于规范化外推域,抑制振荡误差增长。这些元素共同构成了ResilPhase,一个抗噪加速框架。在FLUX.1-dev和HunyuanVideo上的实验表明,在激进的加速比下实现了最先进的保真度。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:17

# ResilPhase: 即插即用的相位映射与抗噪宏轨迹外推加速扩散模型

来源: https://arxiv.org/html/2606.26769

11. 浙江大学, 杭州, 中国
11. 邮箱: [email protected]

###### 摘要

强大扩散模型的采用因其显著的推理延迟而受到阻碍。最近的“缓存再预测”方案通过使用基于导数的多项式加速DiT来缓解这一问题,但在高加速比下会出现严重的质量下降。我们的分析揭示了其根本原因:在那些与连续扩散轨迹不对齐且数值不稳定的表示上执行离散外推。因此,加速后的DiT会遭遇累积的空间误差、噪声导数放大以及高阶不稳定性。因此,我们将在常微分方程空间中加速推理重新定义为稳定的宏轨迹外推。我们不预测中间特征,而是将预测与模型的全局漂移对齐,即端到端的状态演化,从而消除特征不一致性和内存开销。然而,即使这种平滑的宏轨迹仍然容易受到导数谬误的影响:其高阶时间导数本质上是嘈杂的。因此,我们引入了一种无导数的重心拉格朗日外推器,有效绕过导数不稳定性和近似误差。我们进一步提出了一种有界的相位映射,用于正则化外推域,抑制振荡误差增长。这些元素共同构成了ResilPhase,一个抗噪加速框架。在FLUX.1-dev和HunyuanVideo上的实验表明,在激进的加速比下实现了最先进的保真度。代码已公开在 https://github.com/zqc214/ResilPhase。

## 1 引言

扩散Transformer因其可扩展的架构,已成为高保真视觉生成的金标准。然而,它们的性能是通过迭代去噪过程实现的,需要数十到数百个无法并行的顺序前向步骤。这已成为阻碍DiT实时和大规模部署的重大延迟瓶颈。FLUX.1-dev在A100显卡上生成一张图像需要23.69秒。

为了解决这个延迟瓶颈,近期无训练的加速努力已从被动的“缓存再重用”范式演变为使用多项式预测特征轨迹的“缓存再预测”方法。然而,这种主流范式在高加速比下会遭遇严重的质量下降。我们认为这种失败源于一个根本原因:对与连续扩散轨迹不对齐且数值不稳定的中间表示执行离散外推。

这个根本原因表现为三个相互交织的限制。首先,从空间角度来看,大多数方法依赖计算密集的逐层范式。在Transformer块内对高度不稳定的微特征拟合多项式,会沿着网络深度级联误差,并产生大量内存开销。虽然直接预测绝对输出(如FreqCa)绕过了这一点,但正如Δ-DiT所指出的,它丢弃了高度相关的输入先验,限制了预测保真度边界。相反,重用残差位移的方法(如Δ-DiT)仍然局限于局部微观更新,缺少宏观连续动态。因此,现有范式缺乏一个既能保留输入先验又能与ODE向量场严格对齐的端到端目标。

图1: 通过相位映射抑制数值不稳定性。(a) 在均匀时间步上的标准轨迹外推遭受龙格现象,导致混乱的边缘振荡。(b) 我们的方法将离散步骤映射到一个有界的相位空间,最小化稳定拟合的误差界。

其次,从时间角度来看,当前的预测方法(如TaylorSeer和HiCache)完全依赖基于导数的近似。它们关键地忽略了动态轨迹的数学本质:虽然宏轨迹本身是平滑的,但其在时间上的高阶导数本质上是混乱的(如图2(b)所示)。通过有限差分估计这些导数会指数级放大噪声。第三,从数值近似角度来看,在均匀、离散的时间步上进行多项式外推本质上会触发龙格现象。这种数值不稳定性导致外推误差界在区间边缘不可控地增长,最终在激进的加速比下导致灾难性的质量下降。

为了克服这些相互交织的瓶颈,我们提出了ResilPhase,一个明确解决现有范式在空间、时间和数值方面限制的抗噪加速框架。

首先,为了解决逐层预测中固有的空间级联误差,ResilPhase将预测目标转移到网络的宏观动态演化。我们提出了与ODE对齐的宏轨迹目标,将预测目标定义为全局漂移:模型最终输出与初始输入之间的端到端状态位移。与在Transformer块内拟合高度振荡的微信号的逐层方法不同,预测GD将使外推器与连续概率流ODE对齐。这种范式转变消除了缓存块特征的内存开销,并严格切断了跨网络层的误差累积。

图2: 无导数预测策略的有效性。与(a)我们平滑的全局宏轨迹不同,(b)先前方法使用的有限差分导数轨迹本质上是混乱的。将多项式外推应用于这种不稳定动态会导致严重的预测偏差。如(c)所示,评估纯数学预测器表明,我们的无导数拉格朗日外推器在不同外推间隔(N)下保持显著较低的L1相对误差,优于基于导数的求解器(泰勒、埃尔米特)。

虽然预测GD产生了一个适合预测的理想平滑宏轨迹(图2(a)),但它反而放大了基于导数方法的弱点。与逐层微特征一样,GD的高阶时间导数仍然本质上是混乱的。将泰勒或埃尔米特等基于导数的求解器应用于这种噪声信号会导致发散预测。此外,跨离散步骤对这些导数的有限差分估计会引入复合近似误差。为了避免这一点,我们提出了一种受拉格朗日插值启发的无导数外推器。我们避免了标准的O(N²)公式,开发了一种缓存和重用权重的重心预测方案。这将复杂度降低到O(N),同时消除了导数噪声。作为一种纯数学预测器,我们的方法在外推间隔上实现了显著更低且更稳定的误差(图2(c))。

即使采用了鲁棒的无导数公式,在均匀离散时间步上进行多项式外推仍然容易受到龙格现象的影响。如图1(a)所示,这种数值不稳定性导致严重的边缘振荡;ResilPhase是第一个将其识别为扩散加速中关键瓶颈的工作。为了解决这个问题,我们引入了一个即插即用的相位映射机制(图1(b))。作为第一个从理论上将离散时间外推域进行重新映射的技术,我们通过使用切比雪夫节点将线性时间步(t)投影到一个有界相位域(s),从而将经典数值分析与扩散加速联系起来,实现了类条件生成的最优稳定性。此外,我们提出了一种针对复杂文本到图像和视频任务定制的数据驱动平衡映射。通过在这个有界连续空间内执行外推,我们的映射有效地将发散数值问题转化为高度稳定的预测,严格最小化了外推误差的数学上界。

总之,我们的主要贡献如下:
- • 我们提出了与ODE对齐的宏轨迹目标。通过预测模型的全局漂移而不是逐层特征,我们严格切断了空间级联误差,与连续扩散ODE对齐,并消除了大量内存开销。
- • 我们引入了一个抗噪、无导数的重心拉格朗日外推器。这个O(N)框架通过完全绕过有限差分近似的固有噪声和混乱的高阶导数,与GD完美协同。
- • 我们设计了一个即插即用的相位映射机制。通过将离散时间步非线性投影到一个有界相位空间,它正则化了外推域以抑制振荡误差增长,严格最小化了多项式外推误差界。
- • 大量实验表明,ResilPhase在FLUX.1-dev和HunyuanVideo上实现了约5倍的加速,同时保持高度竞争性的保真度。此外,相位映射作为一种即插即用的稳定器,可以减轻现有基于导数的加速器中的外推误差。

## 2 相关工作

### 2.1 扩散Transformer与传统加速

扩散Transformer通过一个顺序的噪声逆转过程实现高保真生成,这从根本上引入了严重的推理延迟瓶颈。为了缓解这一点,早期的加速努力主要集中在模型压缩,如网络剪枝和量化,或通过高效求解器和知识蒸馏减少步骤。然而,这些方法通常需要计算昂贵的重新训练来恢复生成质量,并且往往依赖复杂算法设计。这种依赖性从根本上限制了它们的即插即用通用性,推动了近期研究向更灵活、无训练的加速范式发展。

### 2.2 基于特征缓存的加速

特征缓存是主要的无训练扩散加速策略,从被动重用时间特征演变为主动预测它们。虽然近期方法如DiCache动态调整缓存间隔,但这些预测方法共享关键限制。在空间上,逐层预测会引入内存开销并跨网络深度放大微特征误差。在时间上,这些方法隐式假设平滑的高阶导数,依赖有限差分近似。然而,使用泰勒级数、埃尔米特多项式或基于ODE预测的方法遇到了数学瓶颈:虽然宏轨迹是平滑的,但其时间导数本质上是混乱的。因此,将这些噪声信号应用于基于导数的预测使其容易受到龙格现象等数值不稳定性的影响,限制了最大加速和鲁棒性。

图3: ResilPhase加速框架。(a) 我们从逐层特征转向与ODE对齐的全局漂移,即端到端状态位移。(b) 相位映射通过切比雪夫映射或平衡映射将离散时间步非线性投影到有界相位空间,以抑制数值不稳定性。(c) 流水线每N步执行一次完整计算,而我们的阶数为m的无导数重心拉格朗日外推器为中间步骤估计GD。

## 3 方法论

### 3.1 预备知识与导数引起的不稳定性

扩散Transformer:DiT模型在概率流ODE中充当可学习的速度场。它由L个Transformer块堆叠而成。我们将第l个块的变换记为g_l,其中l∈{1,...,L}。对于时间步t的输入潜在状态x_t和条件c,端到端映射是这些块的组合:G(x_t, c) = g_L(g_{L-1}(...g_1(x_t, c)...))。因此,输入(x_t, c)通过这个完整过程G被转换为最终输出速度(或噪声预测)。

基于预测缓存的加速:为了减少推理延迟,预测缓存使用稀疏调度。给定加速比N,完整前向传递仅在锚定时间步(例如t, t-N, ...)进行。对于中间步骤,计算被跳过,特征通过轻量级预测器估计。传统上,这种预测是逐层的。设F(x_t^l)表示第l...

相似文章

读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

arXiv cs.CL

本文介绍了 CAPR(缓存摊销路径精化),一种用于扩散大语言模型的强化学习算法。该算法无需完整树展开的计算开销,即可从去噪轨迹中提取类树状监督信号。CAPR 在 GSM8K、Math500、数独和倒计时等推理基准测试上达到了最先进的性能,计算成本仅为平坦展开方式的约 0.75 倍。

学习离散化:基于扩散的自适应网格与谱引导

arXiv cs.LG

本文提出了一种基于扩散的框架,用于学习条件于观测到的偏微分方程动力学的自适应网格离散化,利用谱引导和物理约束在需要的地方分配分辨率。该方法在五种偏微分方程场景中取得了具有竞争力或更优的性能。