面向流匹配的单侧分位数耦合

arXiv cs.LG 论文

摘要

提出了分位数耦合流匹配(QC-FM),这是一种轻量级的单侧耦合方法,它沿着随机方向从数据秩构建源样本,无需成对成本矩阵或分配。在CIFAR-10、CelebA、FFHQ和ImageNet-64上,相比基线实现了高达12.9%的FID改进。

arXiv:2608.00978v1 公告类型:新 摘要:流匹配通过回归简单源分布与目标数据分布之间概率路径的速度场来训练连续时间生成模型。将源样本与目标样本配对的耦合方式强烈影响优化过程和样本质量,但结构化耦合通常依赖于小批量传输或分配程序,其成本随批量大小至少呈二次增长。我们提出了分位数耦合流匹配(QC-FM),一种轻量级的单侧耦合方法:它不是匹配两个预先采样的批量,而是仅采样数据批量,并直接构造每个配对的源样本。沿少量随机正交方向投影的数据秩被映射到高斯分位数,潜在代码在正交补空间中通过条件高斯采样完成。该构造每个切片是一维的,因此耦合不需要成对成本矩阵,也不需要求解分配问题。我们证明,对于每个抽取的框架,该耦合在每条选定切片上消除了不可约的回归方差,并使理想流在该处完全笔直,同时保持采样先验不变:生成仍从标准高斯开始,训练源仅通过切片代码的copula偏离标准高斯,而我们对copula的传输成本进行了界定。在训练中,我们将QC应用于锚定子集,并用精确的高斯样本填充剩余的源槽位,既保留了QC偏差,又保留了来自基线耦合的显式信号。在CIFAR-10、CelebA、FFHQ和ImageNet-64上,在匹配的训练预算下,QC-FM优于基线,FID最多降低12.9%,并在所有四个数据集上优于OT-CFM。这些结果表明,保留投影秩结构是一种简单且可扩展的方法,可以在不解决小批量传输问题的情况下,向流匹配耦合注入有用的几何偏差。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:44

# 单侧分位数耦合用于流匹配
来源:https://arxiv.org/html/2608.00978

###### 摘要

流匹配(Flow Matching, FM)通过回归简单源分布与目标数据分布之间概率路径的速度场来训练连续时间生成模型。将源样本与目标样本配对的耦合方式会强烈影响优化过程和样本质量,但结构化耦合通常依赖于小批量运输或分配过程,其成本随批量大小至少呈二次方增长。我们提出**分位数耦合流匹配(Quantile Coupling Flow Matching, QC-FM)**,一种轻量级的*单侧*耦合:它不匹配两个预先采样的批量,而是仅采样数据批量,并直接构造每个配对的源样本。数据沿少量随机正交方向投影后的秩被映射为高斯分位数,潜在编码在正交补空间中通过条件高斯采样完成。该构造在每个切片上是一维的,因此耦合无需成对代价矩阵,也无需求解分配问题。我们证明,对于每个给定的投影帧,这种耦合在每条选定切片上消除了不可约的回归方差,并使理想流在该方向上完全直线化,同时保持采样先验不变:生成仍然从标准高斯分布开始,训练源仅通过切片编码的 copula 偏离该先验,而我们对其运输代价给出了界。在训练中,我们将 QC 应用于一个锚点子集,并用精确高斯样本补全其余源位置,从而在保留 QC 偏置的同时维持来自 Baseline 耦合的显式信号。在 CIFAR-10、CelebA、FFHQ 和 ImageNet-64 上,QC-FM 在相同训练预算下优于 Baseline,FID 最多降低 12.9%,并在全部四个数据集上优于小批量 OT-CFM。这些结果表明,保持投影秩结构是一种简单且可扩展的方式,可以无需解决小批量运输问题即可向 FM 耦合注入有用的几何偏置。

## 引言

流匹配(FM)通过直接回归从源分布到目标数据分布的概率路径的速度场,已成为训练连续时间生成模型的有效框架(Lipman et al. 2023 (https://arxiv.org/html/2608.00978#bib.bib2))。标准选择使用高斯源以及源样本与数据样本之间的线性插值,从而得到简单高效的训练目标。尽管这一形式简单,源样本与目标样本之间耦合的质量在决定所诱导训练轨迹的几何形态方面起着核心作用。较差的耦合会导致不必要地过长或相互冲突的路径,从而增加目标速度场的方差并降低训练效率。虽然最近的课程式方法通过去噪难度或时间间隔逐步组织从噪声到数据的学习问题(Kim et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib47), 2026 (https://arxiv.org/html/2608.00978#bib.bib48)),我们关注的是一个互补的轴:直接构造每次更新所使用的噪声-数据端点耦合。

受最优传输(OT)启发的结构化耦合可以减少轨迹交叉并缩短传输路径,通常带来更快的收敛和更好的生成质量。然而,现有的结构化方法通常依赖小批量 OT 或相关的匹配过程,这些过程需要构造成对代价矩阵并求解逐批量分配问题。随着数据维度和批量大小的增长,这些过程变得日益昂贵,而且其逐批量的特性可能引入额外的不稳定性或偏差。在本文中,我们提出一个问题:能否完全不需要匹配两个预先采样的批量,就能获得结构化耦合的几何优势?我们的答案是**分位数耦合流匹配(QC-FM)**,一种*单侧*耦合方案:QC-FM 不抽取噪声批量并重新与数据配对,而是仅采样数据批量并直接构造每个配对的源样本。每个数据点沿少量随机正交方向进行排序,并将秩映射为高斯分位数,从而使源样本在每条切片上保持数据的批量序关系。其余方向通过条件高斯采样完成,所得的源样本在选定切片上是结构化的,在其他方向上则是随机的。

QC-FM 是一种批量局部的结构化耦合:它沿 k 条随机切片施加单调的一维传输。每条切片通过对固定高斯分位数网格进行排序实现,因此无需构造成对代价矩阵,也无需求解分配问题。由于分位数是在当前小批量内计算的,QC-FM 是结构化耦合的一种替代实现,而非全局 OT 的近似;其目标是恢复通常与结构化耦合相关的优化收益,而不是计算最优匹配。

QC 耦合是本文方法的理论原语。在训练中,QC 为批量的*锚点*子集指定源样本,其余源位置用来自高斯先验的精确样本补全。这些高斯余项补全方案保留了受控量的 QC 结构,同时维持来自 Baseline 耦合的显式信号。**QC-FM-Mixture** 将高斯余项随机配对,而 **QC-FM-Adjacency** 使用相同的高斯余项,但通过 QC 锚点诱导的邻域进行配对,且每个数据目标恰好使用一次。这些混合方案是实用的补全方案,而非单独声称的最优耦合。

我们的实验覆盖 CIFAR-10、CelebA、FFHQ 和 ImageNet-64。在相同训练 epoch 数下,QC-FM-Mixture 在全部四个数据集上优于 Baseline,并在每个数据集上优于小批量 OT-CFM。这些结果表明,投影秩保持是一种有前景的低成本替代方案,可用于流匹配中的全小批量运输。

本文的贡献如下:

- • 我们提出**分位数耦合流匹配(QC-FM)**,一种基于投影秩到分位数匹配和条件高斯补全的轻量级批量式源构造方法,用于流匹配。
- • 我们为 QC 耦合原语建立了理论分析:对于固定帧,它消除了选定切片上的不可约方差,并使每切片理想流为直线;我们还量化了运输代价收益、方向重采样的影响、有限批量近似,以及使训练源偏离采样先验的切片编码之间的依赖关系。
- • 我们引入两种高斯余项补全方案 **QC-FM-Mixture** 和 **QC-FM-Adjacency**,它们将 QC 应用于锚点子集,用精确高斯样本补全其余源位置,区别在于高斯余项的配对方式。
- • 我们在 CIFAR-10、CelebA、FFHQ 和 ImageNet-64 上证明 QC-FM-Mixture 优于 Baseline 和小批量 OT-CFM,并分析了锚点比例和切片数量的权衡。

## 相关工作

##### 流匹配。
流匹配(Lipman et al. 2023 (https://arxiv.org/html/2608.00978#bib.bib2))通过回归生成从源分布到数据的指定概率路径的速度场,训练连续归一化流(Chen et al. 2018 (https://arxiv.org/html/2608.00978#bib.bib1))。相关公式包括 rectified flow(Liu et al. 2023 (https://arxiv.org/html/2608.00978#bib.bib3))和随机插值(stochastic interpolants)(Albergo and Vanden-Eijnden 2023 (https://arxiv.org/html/2608.00978#bib.bib4); Albergo et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib5))。在 Baseline 公式中,高斯源和数据样本独立抽取,并通过线性插值连接,因此两个端点随机配对。

##### 通过小批量分配实现耦合。
一条研究路线用在小批量内计算的结构化耦合取代这种独立配对。多样本流匹配(Multisample flow matching)(Pooladian et al. 2023 (https://arxiv.org/html/2608.00978#bib.bib8))和 OT-CFM(Tong et al. 2024 (https://arxiv.org/html/2608.00978#bib.bib9))引入了非平凡的小批量耦合:它们独立抽取噪声批量和数据批量,形成两个大小为 \(B\) 的批量之间的 \(B\times B\) 代价矩阵,并通过求解分配问题重新配对(精确求解为 \(O(B^3)\),在熵正则化下每次迭代为 \(O(B^2)\))。后续工作进一步改进这种耦合(Lin et al. 2026 (https://arxiv.org/html/2608.00978#bib.bib11); Davtyan et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib12); Li et al. 2024 (https://arxiv.org/html/2608.00978#bib.bib13))。这些耦合使流更直,但继承了小批量 OT 的统计偏差(Fatras et al. 2020 (https://arxiv.org/html/2608.00978#bib.bib16); Boïté et al. 2026 (https://arxiv.org/html/2608.00978#bib.bib17)),其收益主要在大批量时显现(Zhang et al. 2026 (https://arxiv.org/html/2608.00978#bib.bib18)),尽管成本可以被摊还(Mousavi-Hosseini et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib19))。所有这些方法都共享一种双侧设计:先采样两个端点,然后耦合是它们之间的匹配。QC-FM 则是*单侧*的:它仅采样数据批量,并直接针对固定高斯分位数网格*合成*配对的源样本。每条切片归结为一维同单调耦合(定理 A.3 (https://arxiv.org/html/2608.00978#A1.Thmtheorem3)),通过 \(O(B\log B)\) 的排序实现;没有 \(B\times B\) 代价矩阵,没有批量分配,且采样先验不变。

##### 数据相关先验。
另一条互补路线使源依赖于数据,而不是匹配两个批量。数据相关随机插值(Albergo et al. 2024 (https://arxiv.org/html/2608.00978#bib.bib20))将源条件于数据,但面向超分辨率和修复等条件任务。对于无条件生成,这种依赖通常通过与流联合训练的可变分噪声耦合来学习(Silvestri et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib22))。与 QC-FM 最接近的是两项近期工作,它们无需学习即可构建源:Chemseddine et al. (2026 (https://arxiv.org/html/2608.00978#bib.bib23)) 通过一维分位数函数拟合数据自适应先验,但仍通过小批量 OT 进行耦合;Malnick et al. (2026 (https://arxiv.org/html/2608.00978#bib.bib24)) 将每张图像自身的低频内容作为其先验。QC-FM 共享这种“构造而非匹配”的理念,但不需要任何学习组件,也不改变*采样*先验:推理时无需学习或存储任何内容,生成仍从标准高斯分布开始。我们的源由批量内秩通过高斯分位数变换构建;当 \(k=1\) 时它恰好等于标准高斯,当 \(k\ge 2\) 时,仅通过与高斯不同的 copula 产生偏差,而我们在定理 A.7 (https://arxiv.org/html/2608.00978#A1.Thmtheorem7) 中对该 copula 的运输代价给出了界。

##### 切片传输与基于秩的构造。
一维 OT 是 QC-FM 每切片机制的基础:二次问题通过匹配分位数的同单调耦合以闭式求解(Hoeffding 1940 (https://arxiv.org/html/2608.00978#bib.bib25); Villani 2009 (https://arxiv.org/html/2608.00978#bib.bib27)),这也是切片 Wasserstein 距离的基础(Rabin et al. 2011 (https://arxiv.org/html/2608.00978#bib.bib28); Bonneel et al. 2015 (https://arxiv.org/html/2608.00978#bib.bib29); Kolouri et al. 2019 (https://arxiv.org/html/2608.00978#bib.bib30))。切片传输计划将一维计划提升回原空间,也被用于耦合流匹配批量(Tanguy et al. 2025 (https://arxiv.org/html/2608.00978#bib.bib32); Chapel et al. 2026 (https://arxiv.org/html/2608.00978#bib.bib31))——同样是对两个独立批量的匹配。秩到高斯分位数的映射本身是经典工具,是高斯化方法的基础(Chen and Gopinath 2000 (https://arxiv.org/html/2608.00978#bib.bib33); Laparra et al. 2011 (https://arxiv.org/html/2608.00978#bib.bib34); Dai and Seljak 2021 (https://arxiv.org/html/2608.00978#bib.bib35))。QC-FM 在批量局部一次性地应用这一原语,而不是将其组合成一个独立的生成模型。与此同时,Groom et al. (2026 (https://arxiv.org/html/2608.00978#bib.bib36)) 为分布强化学习提出了一种分位数耦合目标,在每个批量内将标量返回与噪声排序;而 QC-FM 通过随机正交投影作用于高维数据。

## 方法

### 预备:流匹配

设 \(p_0\) 表示简单源分布,通常为 \(p_0=\mathcal{N}(0,I)\),设 \(p_1\) 表示数据分布。FM 训练一个时间相关的向量场 \(v_\theta(x,t)\),以匹配源样本 \(x_0\sim p_0\) 与数据样本 \(x_1\sim p_1\) 之间指定条件概率路径的速度。Baseline 使用线性路径 \(x_t=(1-t)x_0+tx_1\),其中 \(t\in[0,1]\),目标速度为 \(u_t=x_1-x_0\)。模型通过最小化

\[
\mathcal{L}_{\mathrm{FM}}(\theta)=\mathbb{E}_{t,x_0,x_1}\left[\left\|v_\theta(x_t,t)-u_t\right\|^2\right].
\]

尽管目标简单,\(x_0\) 与 \(x_1\) 之间的耦合选择强烈影响训练轨迹的几何形态。Baseline 易于采样,但可能产生较长或相互冲突的路径,从而增加目标速度场的方差。结构化耦合可以改善这种几何形态,但现有方法通常依赖求解小批量运输问题。我们的目标是在无需显式批量分配的情况下获得结构化耦合的部分收益。

### 分位数耦合流匹配

#### 概述

我们提出**分位数耦合流匹配(QC-FM)**,一种轻量级单侧耦合方法,沿少量随机投影保持数据样本的相对顺序。给定数据批量 \(\mathcal{B}_x=\{x^{(1)},\dots,x^{(B)}\}\subset\mathbb{R}^d\),QC-FM 通过将投影数据秩匹配到高斯分位数,构造相应的潜在批量 \(\mathcal{B}_e=\{e^{(1)},\dots,e^{(B)}\}\subset\mathbb{R}^d\)。所得耦合在选定投影方向上是结构化的,在其余方向上是随机的。

#### 构造

设 \(U=[u_1,\dots,u_k]\in\mathbb{R}^{d\times k}\) 的列是正交投影方向,例如通过对高斯随机矩阵进行 QR 分解得到。对于每个数据点 \(x^{(i)}\) 和方向 \(u_j\),我们计算标量投影 \(v_{ij}=u_j^\top x^{(i)}\)。在每个投影 \(j\) 内,我们对批量中的值 \(\{v_{1j},\dots,v_{Bj}\}\) 进行排序。对于批量 \(\mathcal{B}\),设 \(r_j(x;\mathcal{B})\in\{1,\dots,|\mathcal{B}|\}\) 表示 \(u_j^\top x\) 在 \(\{u_j^\top x':x'\in\mathcal{B}\}\) 中的秩,其中秩 \(1\) 表示最小值,并记 \(r_{ij}:=r_j(x^{(i)};\mathcal{B}_x)\)。我们对经验秩进行连续性校正,并通过标准正态逆 CDF 映射:\(\tau_{ij}=\frac{r_{ij}-0.5}{|\mathcal{B}_x|}, z_{ij}=\Phi^{-1}(\tau_{ij}\)

相似文章

基于功能流匹配的量子分布生成建模

arXiv cs.LG

提出量子流匹配(Quantum Flow Matching, QFM),一种利用自旋Wigner函数和功能流匹配来学习并生成多量子比特量子分布的生成模型,能够准确捕捉纯度和纠缠熵等物理性质。

基于最优传输势的多边缘流匹配

arXiv cs.LG

提出OTP-FM,一种新颖的多边缘流匹配方法,利用最优传输势来软性地引导流通过中间边缘分布,在单细胞RNA测序、海洋学和气象学数据集上实现了最先进的性能。

MeshFlow: 基于等变流匹配的网格生成

Hugging Face Daily Papers

MeshFlow 引入了一种等变最优传输流匹配模型,用于直接生成三角形网格,在达到最先进质量的同时,相比自回归方法提供了约18倍的推理加速。