二阶漂移模型(Second-Order Drifting Models)

arXiv cs.LG 论文

摘要

本文提出了二阶漂移模型(Second-Order Drifting Models),通过引入人工速度变量增强漂移生成模型,在傅里叶空间中实现加速的二阶动力学,从而在保持单步推理的同时缓解谱刚度。该方法在合成分布匹配、序列数据生成和机器人控制上进行了评估,表现出更好的收敛性和有竞争力的性能。

arXiv:2608.07924v1 公告类型:新论文 摘要:漂移模型(Drifting Models)是最近一类单步生成模型,在训练过程中使用预定义的基于样本的漂移场来演化模型分布。尽管它们避免了迭代推理,但其基于核的漂移场会导致与频率相关的训练动力学:在线性化区域中,密度残差的每个傅里叶模式以由核谱决定的速率衰减,导致细尺度结构恢复缓慢。我们提出了二阶漂移模型(Second-Order Drifting Models),通过为生成样本添加人工速度变量,将漂移动力学提升到相空间中。我们证明了由此产生的密度扰动在傅里叶空间中服从加速的二阶动力学,将漂移模型与优化理论中著名的Nesterov加速联系起来。这为缓解一阶漂移的谱刚度提供了一种有原理的机制,同时保持单步推理。我们推导了一种实用的半隐式训练算法,并在合成分布匹配、序列数据生成和机器人控制上对其进行了评估。在这些设置中,二阶漂移模型改善了收敛行为,并相对于一阶漂移基线实现了有竞争力或更优的性能。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# 二阶漂移模型
来源:https://arxiv.org/html/2608.07924
Drake Brown\*、Yuhao Huang\*、Shih\-Hsin Wang、Bao Wang
数学系,科学计算与成像(SCI)研究所,犹他大学
1Drake Brown 和 Yuhao Huang 为共同第一作者。

###### 摘要

漂移模型是一类新近提出的单步生成模型,它在训练过程中利用预定义的基于样本的漂移场来演化模型分布。尽管这类模型避免了迭代推理,但其基于核的漂移场会引入频率相关的训练动力学:在线性化范围内,密度残差的每个傅里叶模式以由核谱决定的速率衰减,导致细粒度结构的恢复缓慢。我们提出了二阶漂移模型(Second\-Order Drifting Models),通过为生成样本引入人工速度变量,将漂移动力学提升到相空间。我们证明了由此产生的密度扰动在傅里叶空间中遵循加速的二阶动力学,从而将漂移模型与优化理论中著名的 Nesterov 加速联系起来。这为缓解一阶漂移的谱刚性提供了一种有原理依据的机制,同时保持了单步推理。我们推导了一种实用的半隐式训练算法,并在合成分布匹配、序列数据生成和机器人控制上进行了评估。在这些设置中,二阶漂移模型改善了收敛行为,并在一阶漂移基线上取得了具有竞争力或更优的性能。

## 1 引言

基于流的生成模型——特别是基于扩散(参见 [43](https://arxiv.org/html/2608.07924#bib.bib43)、[18](https://arxiv.org/html/2608.07924#bib.bib18)、[46](https://arxiv.org/html/2608.07924#bib.bib46))和流匹配(参见 [28](https://arxiv.org/html/2608.07924#bib.bib28)、[1](https://arxiv.org/html/2608.07924#bib.bib1)、[29](https://arxiv.org/html/2608.07924#bib.bib29)、[20](https://arxiv.org/html/2608.07924#bib.bib20))机制的模型——可以表述为学习一个变换 \(f\),使得源分布 \(q\) 的推前(pushforward)\(f_{\sharp}q\) 匹配目标数据分布 \(p\),即 \(f_{\sharp}q\approx p\)。即使这些变换在高保真生成中表现出色 [39](https://arxiv.org/html/2608.07924#bib.bib39)、[19](https://arxiv.org/html/2608.07924#bib.bib19)、[52](https://arxiv.org/html/2608.07924#bib.bib52)、[48](https://arxiv.org/html/2608.07924#bib.bib48)、[22](https://arxiv.org/html/2608.07924#bib.bib22),它们也是通过微分方程定义的,并且在推理时需要迭代求值——每个样本常常需要数百次神经函数评估(NFE)。这使得生成在计算上很昂贵,并限制了实时应用,从而推动了高质量单步模型的发展,包括一致性模型 [45](https://arxiv.org/html/2608.07924#bib.bib45)、[44](https://arxiv.org/html/2608.07924#bib.bib44)、流映射 [5](https://arxiv.org/html/2608.07924#bib.bib5)、[6](https://arxiv.org/html/2608.07924#bib.bib6) 和 Meanflows [14](https://arxiv.org/html/2608.07924#bib.bib14)、[21](https://arxiv.org/html/2608.07924#bib.bib21)。

最近,漂移模型 [10](https://arxiv.org/html/2608.07924#bib.bib10) 被提出,旨在通过将分布匹配完全转移到训练阶段来解决这一效率问题。在该框架中,神经网络 \(f_\theta\) 充当单步生成器,将简单的先验分布 \(q\)(例如高斯噪声)直接映射到数据空间中的样本。在任意训练时刻 \(t\),模型产生一个推前分布 \(q_t=f_{\theta_t\sharp}q\)。学习的目标是演化 \(q_t\) 使其匹配目标数据分布 \(p\)。关键在于,该模型并不显式地学习由神经网络参数化的向量场。相反,训练由一个预先设计的漂移场 \(V_{p,q_t}(x)\) 引导,该漂移场同时依赖于当前生成分布 \(q_t\) 和目标分布 \(p\)。这个场规定了样本 \(x_t\sim q_t\) 应当如何移动,以减少 \(q_t\) 与 \(p\) 之间的差异。直观地说,\(V_{p,q_t}(x)\) 可以看作一个速度场,它吸引生成样本向高数据密度区域移动,同时排斥它们离开 \(q_t\) 中过度表示的区域。

在训练过程中,神经网络参数随迭代而变化,\(\theta_t\to\theta_{t+\Delta t}\),这又引起了生成样本的相应演化。对于固定的噪声输入 \(\epsilon\sim q\),生成样本遵循轨迹 \(x_t=f_{\theta_t}(\epsilon)\)。因此,参数更新导致位移

\[
x_{t+\Delta t}-x_t\approx V_{p,q_t}(x_t)\,\Delta t,
\]

这意味着样本的变化由漂移场驱动。在这个意义上,网络参数的优化根据 \(V_{p,q_t}\) 隐式地传输样本。从连续时间的观点来看 [49](https://arxiv.org/html/2608.07924#bib.bib49),取极限 \(\Delta t\to 0\) 得到常微分方程(ODE)

\[
\frac{dx_t}{dt}=V_{p,q_t}(x_t).
\]
(1)

该 ODE 刻画了样本层面的训练动力学:生成分布 \(q_t\) 沿着向量场 \(V_{p,q_t}\) 流动而演化。在平衡态,当 \(q_t=p\) 时,漂移场消失,动力学达到不动点。更详细的推导见第 3 节。

漂移场通过核平滑构造(参见第 2 节),其中样本之间的相互作用由相似性核(例如高斯核)加权,产生一种吸引–排斥机制,用于量化数据分布 \(p\) 与生成分布 \(q\) 之间的差异。然而,这种基于核的平滑在傅里叶域中本质上是一个低通滤波器,会衰减分布的高频分量 [49](https://arxiv.org/html/2608.07924#bib.bib49)。因此,由此产生的动力学表现出明显的谱偏差:低频模式收敛很快,而高频模式衰减慢得多——在高斯核下是指数级缓慢。即使使用拉普拉斯核,类似的问题依然存在,尽管没有那么严重。这种谱偏差造成了根本性的瓶颈,减慢了收敛速度,并限制了模型准确捕捉数据细粒度特征的能力;详细分析见第 3 节。

### 1.1 我们的贡献

受上述谱瓶颈的启发,我们提出了**二阶漂移模型**,通过引入辅助速度变量 \(v\) 将动力学提升到相空间:

\[
\begin{cases}
\frac{dx}{dt}=v,\\
\frac{dv}{dt}=V_{p,q_t}(x)-\gamma v,
\end{cases}
\]
(2)

其中 \(\gamma>0\) 是阻尼系数(可以依赖于 \(t\))。通过引入惯性/速度,由此产生的动力学可以有效地缓解核平滑带来的低通偏差。

在分布层面,线性化动力学在傅里叶空间中遵循二阶 ODE,将每个模式转化为类似于 Nesterov [32](https://arxiv.org/html/2608.07924#bib.bib32) 动力学的加速系统。因此,收敛不再受核谱 \(\lambda(\omega)\) 的约束,而是可以通过阻尼调度来调节,从而有效降低谱刚性,加速高频恢复。在这一见解的指导下,我们开发了一种半隐式二阶训练算法,该算法保持单步生成,同时提高稳定性、收敛性和细粒度保真度。实验表明,我们的方法在合成生成、序列数据生成和机器人控制任务中均取得了一致的改进。总之,我们的贡献有三点:

- **加速视角**。我们将一阶漂移视为谱不平衡的,并引入动量以抵消其低通偏差。
- **二阶动力学**。我们提出一种相空间表述,其傅里叶动力学恢复了 Nesterov 加速,降低了对核谱的依赖。
- **算法与验证**。我们开发了一种半隐式方法,在保持单步推理的同时,改善了跨任务的收敛性和高频保真度。

### 1.2 其他相关工作

加速与二阶优化动力学。基于动量的加速在优化领域有着悠久的历史(参见 [38](https://arxiv.org/html/2608.07924#bib.bib38)、[32](https://arxiv.org/html/2608.07924#bib.bib32))。这些方法的连续时间二阶 ODE 表述已被广泛研究,以刻画收敛速率并指导算法设计(参见 [4](https://arxiv.org/html/2608.07924#bib.bib4)、[47](https://arxiv.org/html/2608.07924#bib.bib47)、[2](https://arxiv.org/html/2608.07924#bib.bib2)、[3](https://arxiv.org/html/2608.07924#bib.bib3)、[40](https://arxiv.org/html/2608.07924#bib.bib40)、[53](https://arxiv.org/html/2608.07924#bib.bib53)、[24](https://arxiv.org/html/2608.07924#bib.bib24))。这类视角也启发了用于神经 ODE 相关模型的加速技术 [35](https://arxiv.org/html/2608.07924#bib.bib35)、[34](https://arxiv.org/html/2608.07924#bib.bib34)、[54](https://arxiv.org/html/2608.07924#bib.bib54)、[51](https://arxiv.org/html/2608.07924#bib.bib51)、[33](https://arxiv.org/html/2608.07924#bib.bib33) 以及扩散模型 [11](https://arxiv.org/html/2608.07924#bib.bib11)。在本文中,我们将这种优化视角引入漂移模型:通过对动力学进行线性化,密度扰动的每个傅里叶模式都表现为一个标量优化问题,其条件数由核谱决定。这一视角使得我们可以设计二阶动力学来加速分布匹配。

漂移模型的进展。最近的几项工作在互补方向上扩展了漂移框架。我们在此仅介绍一些代表性进展,并指出由于篇幅限制,全面综述超出了本文范围。[49](https://arxiv.org/html/2608.07924#bib.bib49) 的作者将漂移模型训练与分数匹配联系起来,为我们的工作提供了理论基础。Sinkhorn 漂移利用与 Sinkhorn 梯度流的联系,在低温区域改善了性能 [16](https://arxiv.org/html/2608.07924#bib.bib16)。一个统一视角通过证明均值漂移方向对应于分数不匹配,将漂移与基于分数的模型联系起来,从而在不同温度区域提供了一致的观点 [25](https://arxiv.org/html/2608.07924#bib.bib25)。从传输的角度看,一种长短流映射表述从基于流的模型推导出漂移,并在减少批量大小的情况下获得了有竞争力的性能 [27](https://arxiv.org/html/2608.07924#bib.bib27)。梯度流漂移将该方法解释为基于核密度估计(KDE)散度的 Wasserstein 梯度流,从而可以设计替代速度场以缓解模式坍缩 [7](https://arxiv.org/html/2608.07924#bib.bib7)。此外,解析校正方法通过闭式调整解决了漂移场中的小批量诱导偏差 [55](https://arxiv.org/html/2608.07924#bib.bib55),而摩擦增强变体引入阻尼机制以稳定动力学,并在域翻译任务中改善了性能 [23](https://arxiv.org/html/2608.07924#bib.bib23)。

## 2 背景:漂移模型

在本节中,我们回顾漂移模型 [10](https://arxiv.org/html/2608.07924#bib.bib10)。设 \(p\) 为 \(\mathbb{R}^d\) 上的目标分布,\(f_\theta:\mathbb{R}^k\to\mathbb{R}^d\) 为生成器,\(q:=(f_\theta)_{\sharp}\mathcal{N}(0,I)\) 为诱导的模型分布,其中 \(\mathcal{N}(0,I)\) 是标准高斯分布。漂移模型直接从样本中学习基于核的**漂移向量场**。

对于正定核 \(k(x,y)\),漂移场 [10](https://arxiv.org/html/2608.07924#bib.bib10) 的一种特定构造为

\[
V_{p,q}(x)=V_p(x)-V_q(x),
\]

其中

\[
V_p(x)=\frac{\mathbb{E}_{y\sim p}[k(x,y)(y-x)]}{\mathbb{E}_{y\sim p}[k(x,y)]},\quad
V_q(x)=\frac{\mathbb{E}_{y\sim q}[k(x,y)(y-x)]}{\mathbb{E}_{y\sim q}[k(x,y)]}.
\]

漂移场 \(V_{p,q}\) 定义了生成样本的停止梯度(stop\-gradient)目标,而 \(f_\theta\)(初始化为 \(\theta_0\))通过使其推前分布匹配漂移后的分布来进行更新,具体如下:

- 采样 \(\epsilon\sim\mathcal{N}(0,I)\) 并计算 \(x_t=f_{\theta_t}(\epsilon)\)
- 漂移:\(x_{t+\Delta t}=x_t+V_{p,q_t}(x_t)\)
- 通过反向传播以下损失函数更新 \(\theta_t\):
  \[
  \mathcal{L}(\theta)=\mathbb{E}_{\epsilon}[\|f_{\theta_t}(\epsilon)-\texttt{sg}[x_{t+\Delta t}]\|^2],
  \]
  其中 \(\texttt{sg}\) 表示停止梯度操作。

收敛后,\(f_\theta\) 直接将先验分布 \(\mathcal{N}(0,I)\) 映射到数据分布 \(p\),从而能够通过一次函数评估(1\-NFE)进行数据生成。

## 3 训练漂移模型的谱视角

在本节中,我们回顾漂移模型的谱分析 [49](https://arxiv.org/html/2608.07924#bib.bib49),说明一阶漂移会导致与频率相关的收敛以及固有的谱刚性。

从 ODE 公式 (1) 出发,设 \(q_t(x)\) 为数据的密度,则有 [49](https://arxiv.org/html/2608.07924#bib.bib49)

\[
\partial_t q_t(x)+\nabla\cdot\big(q_t(x)V_{p,q_t}(x)\big)=0.
\]
(3)

##### 线性化。

我们考虑对一般正定、径向对称核 \(k(x,y)=K(\|x-y\|)\) 的方程 (3) 进行线性化,其中 \(K\) 可积且随 \(\|x-y\|\) 衰减;注意高斯核和拉普拉斯核都满足这些条件。为了在平衡态 \(p\) 附近线性化方程 (3),令 \(\rho_t:=q_t-p\)。在温和假设下(见附录 A),我们可以证明 \(\rho_t\) 满足 PDE:

\[
\partial_t\rho_t(x)=-\nabla\cdot\Big(\int M(x-y)\rho_t(y)dy\Big):=-\nabla\cdot(M*\rho_t)(x),
\]
(4)

其中 \(M(x)=cxK(x)\),\(c\) 为常数。

对上述方程取傅里叶变换……

相似文章

用于优化离散扩散语言模型的漂移目标

arXiv cs.CL

本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。

注意力漂移:自回归投机解码模型学到了什么

Reddit r/LocalLLaMA

本文指出了自回归投机解码模型中的“注意力漂移”现象,即草稿模型的注意力从提示词转移到了其自身生成的令牌上。作者提出了架构上的改进,例如后归一化(Post-norm)和 RMSNorm,这些改进在各种基准测试中提高了接受率和鲁棒性。

Drift Q-Learning

arXiv cs.LG

提出了DriftQL,它结合了基于漂移的行为正则化器与评论家驱动的策略改进,用于离线强化学习,在D4RL和OGBench上优于扩散和流方法,同时保持简单性和效率。