类别生成中的流对偶性与源几何
摘要
本文揭示了连续与离散流匹配之间的对偶性,表明通过逐位置argmax投影连续凸插值路径可得到离散流,并探讨了不同源几何如何影响过渡时机和生成质量。
arXiv:2609.10863v1 Announce Type: new
摘要:连续与离散流匹配通常被视为独立的构造。本文揭示了它们之间的对偶性:通过逐位置argmax投影具有独热目标的连续凸插值路径,可得到离散凸插值路径。该结果要求源分布具有适当的坐标对称性和边界正则性,并使连续源分布成为类别生成的显式设计选择。我们推导了Gaussian、有界均匀和中心负指数源的诱导离散插值行为,表明不同源几何导致质的不同过渡时机和词汇表大小依赖性。小型视觉诊断和简短语言建模试点表明,这些源设计效应也可能出现在学习的传输和早期生成质量中。
查看缓存全文
缓存时间: 2026/09/11 08:20
# 面向分类生成的流对偶性与源几何
来源:https://arxiv.org/html/2609.10863 预印本
###### 摘要
连续与离散流匹配通常被视为独立的构造。本文识别了二者之间的对偶性:通过逐位置的argmax运算,将具有独热目标向量的连续凸插值路径进行投影,即可得到离散凸插值路径。该结果要求源分布具有适当的坐标对称性与边界正则性,并使连续源分布成为分类生成中一个显式的设计选择。我们推导了高斯、有界均匀和中心负指数源所诱导的离散插值行为,表明不同源几何会导致定性不同的转移时序和词汇量依赖关系。简短的视觉诊断和语言建模实验表明,这些源设计效应也可能出现在学习到的传输过程中,并影响早期生成质量。
## 1 引言
针对语言、代码和符号序列等离散对象的生成建模,通常通过离散扩散或离散流匹配来公式化。这类模型在有限状态空间上定义随时间演化的过程,并学习概率速度或去噪分布,将概率质量从简单源分布迁移至数据分布。与此同时,连续扩散与流匹配在欧几里得空间中构建确定性或随机轨迹,其路径几何可被直接研究。近期关于扩散对偶性的工作(Sahoo等人,2025)表明,某些离散扩散过程可被理解为底层连续过程的投影。这自然引出一个问题:对于具有凸插值器的连续流,是否存在类似的对偶性?特别地,若连续流定义在独热token表示上(Lee等人,2026),再通过argmax映射投影回token,会诱导出何种离散流?本文将专门研究这一问题。
我们研究条件轨迹为连续源与独热编码目标之间凸插值的连续流。沿此类轨迹逐位置应用argmax映射,可在有限词汇表上产生一个过程。我们的主要结果表明:在满足argmax兼容的提升耦合、积坐标置换不变且在相关对阈值平面上无原子质量的连续源条件下,该投影过程是一个具有凸插值和均匀源的离散流。当各位置源分布相同时,诱导的插值系数在位置间共享;否则,同样的结论以位置依赖系数的形式成立。这一对偶性使连续源分布成为具有数学意义的设计选择。
在独热分类生成中,目标坐标需在argmax下与源坐标竞争。对于高斯源,这种竞争随着词汇量增大而变得更加困难,因为目标坐标必须超越众多噪声坐标的最大值。因此,诱导的离散系数在大词汇量时会出现延迟。替代源可以改变该系数,并可能影响传输的几何结构。我们通过推导三类源族(高斯、有界均匀和中心负指数)的诱导离散系数来丰富对偶结果。高斯系数依赖于词汇量且具有延迟性;固定词汇量时,有界均匀系数由支撑宽度控制;中心负指数系数具有与词汇量无关的简单形式。我们还包含玩具轨迹可视化,在双点目标问题中比较高斯与平移均匀源。这些图示并非大规模实证,但定性表明源族、位置和尺度既能影响诱导的离散系数,也能影响学到的连续路径几何。
本文组织如下:第2节介绍背景与符号;第3节呈现对偶定理、辅助引理及源系数扩展;第4节总结。所有对偶性证明和系数推导均置于附录。
## 2 背景与符号
以下是离散流匹配的概述。
### 2.1 离散流匹配
为扩展离散扩散模型的设计空间,Campbell等人(2024)和Gat等人(2024)引入了离散流匹配。我们遵循Gat等人(2024)的方法与符号。
在离散序列建模中,序列(状态)\(x\)由\(L\)个元素\(x^1,x^2,\dots,x^L\)组成。每个位置\(i\)包含来自词汇表\(\mathcal{V}\)的元素\(x^i\),其中\(|\mathcal{V}|=V\),我们将其等同于\([V]=\{1,\dots,V\}\)。在非退化情况下\(V \geq 2\);当\(V=1\)时转移系数无关紧要。因此,可能序列的集合为\(\mathcal{D}=[V]^L\)。若两个序列仅在一个位置不同,则称它们为邻居。我们用\(p^i(x^i)\)表示\(p\)在位置\(i\)的边缘分布,即\(p^i(x^i)=\sum_{x^{-i}} p(x)\),其中\(x^{-i}=(x^1,\dots,x^{i-1},x^{i+1},\dots,x^L)\)。
以下delta函数表示法特别有用:
\[
\delta_{y}(x) = \prod_{i=1}^{L} \delta_{y^i}(x^i),
\]
其中
\[
\delta_{y^i}(x^i) =
\begin{cases}
1 & \text{若 } x^i = y^i \\
0 & \text{若 } x^i \neq y^i
\end{cases}.
\tag{1}
\]
#### 2.1.1 概率流与速度
在离散流匹配(Gat等人,2024)中,目标是定义或学习一个流\(p_t(x): [0,1] \times [V]^L \to [0,1]\),满足约束\(\sum_{x \in [V]^L} p_t(x) = 1\),将源(参考)分布\(X_0 \sim p\)变换为目标(数据)分布\(X_1 \sim q\)。该流完全由概率速度\(u_t(x): [0,1) \times \mathcal{D} \to \mathbb{R}^{L \times V}\)的选择决定,其中\(u_t(x) = (u_t^1(x), \dots, u_t^L(x))\)且\(u_t^i(x) \in \mathbb{R}^{V}\)。对于候选token \(a \in [V]\),记\(u_t^i(a,x) := u_t^i(x)[a]\)。这些速率满足:当\(a \neq x^i\)时\(u_t^i(a,x) \geq 0\),且\(\sum_{a \in [V]} u_t^i(a,x) = 0\)。
从时间\(t\)到\(t+\varepsilon\)的状态概率的无穷小一阶更新在每个位置独立定义为:
\[
p^i_{t+\epsilon|t}(a \mid x) = \delta_{x^i}(a) + \epsilon u_t^i(a,x) + o(\epsilon).
\]
因此,如马尔可夫链框架所示,下一步状态的概率仅取决于当前状态,且\(u_t\)扮演类似于转移速率矩阵\(Q_t\)的角色,完全确定了流。若使用神经网络近似概率速度\(u_t(x)\),即\(u_t(x,t;\theta): [V]^L \times [0,1] \to \mathbb{R}^{L \times V}\),则可利用上述更新规则从\(p\)采样并从\(q\)生成数据。
然而,在建模概率速度\(u_t(x)\)之前,必须首先设计一个合适的、实际可学习对应\(u_t(x)\)的流\(p_t(x)\)。
#### 2.1.2 条件概率流
由于在时间\(t=0\)和\(t=1\)必须分别有\(p_0 = p\)和\(p_1 = q\),我们已受限于流的端点。满足此类约束的平凡方式是定义:
\[
p_t(x) = \sum_{x_0, x_1 \in \mathcal{D}} p_t(x \mid x_0, x_1) \pi(x_0, x_1),
\tag{2}
\]
其中\(p_0(x \mid x_0, x_1) = \delta_{x_0}(x)\),\(p_1(x \mid x_0, x_1) = \delta_{x_1}(x)\),且\(\pi(X_0, X_1)\)是满足边缘约束\(p(x) = \sum_{y \in \mathcal{D}} \pi(x,y)\),\(q(y) = \sum_{x \in \mathcal{D}} \pi(x,y)\)的\(X_0\)、\(X_1\)的任意联合分布。
由于概率速度独立更新每个位置的概率,自然可以像Gat等人(2024)那样为每个维度独立定义\(p_t(x \mid x_0, x_1)\):
\[
p_t(x \mid x_0, x_1) = \prod_{i=1}^{L} p_t^i(x^i \mid x_0, x_1),
\tag{3}
\]
其中
\[
p_t^i(x^i \mid x_0, x_1) = (1 - k_t) \delta_{x_0^i}(x^i) + k_t \delta_{x_1^i}(x^i),
\]
且\(k_0 = 0\),\(k_1 = 1\),\(k_t\)单调递增。
显然,这种\(p_t(x \mid x_0, x_1)\)的定义满足条件\(p_0(x \mid x_0, x_1) = \delta_{x_0}(x)\)和\(p_1(x \mid x_0, x_1) = \delta_{x_1}(x)\)。
假设\(k\)在\([0,1]\)上绝对连续。Gat等人(2024)证明,对应于公式(3)和(4)定义的流的条件概率速度的第\(i\)分量\(u_t^i(a,x \mid x_0, x_1)\),对于几乎所有满足\(k_t < 1\)的时间,为:
\[
u_t^i(a,x \mid x_0, x_1) = \frac{\dot{k}_t}{1 - k_t} \left[ \delta_{x_1^i}(a) - \delta_{x^i}(a) \right].
\tag{5}
\]
此外,他们证明对应于无条件流\(p_t(x)\)的概率速度可写为:
\[
u_t^i(a,x) = \sum_{x_0, x_1 \in \mathcal{D}} u_t^i(a,x \mid x_0, x_1) \, p_{0,1|t}(x_0, x_1 \mid x),
\tag{6}
\]
对于公式(4)和(5)的情况,这意味着:
\[
u_t^i(a,x) = \frac{\dot{k}_t}{1 - k_t} \left[ p_{1|t}^i(a \mid x,t) - \delta_{x^i}(a) \right].
\]
然后,通过神经网络建模时间条件后验预测器\(p_{1|t}^i(a \mid x,t;\theta)\)来近似\(u_t^i(a,x)\),并使用交叉熵损失:
\[
\mathcal{L}_{\mathrm{DFM}} = -\mathbb{E}_{t \sim U(0,1)} \mathbb{E}_{x_0,x_1 \sim \pi(x_0,x_1)} \mathbb{E}_{x_t \sim p_{t|0,1}(\cdot \mid x_0,x_1)} \sum_{i=1}^{L} \log p_{1|t}^i(x_1^i \mid x_t, t; \theta).
\tag{7}
\]
需提及,在Gat等人(2024)中,\(p_t^i(x^i \mid x_0, x_1)\)的定义更一般化,但为简便,我们在此专注于此特例。
#### 2.1.3 源与目标分布
如前所述,点\(X_0\)和\(X_1\)从联合分布\(\pi(x,y)\)采样,即\((X_0, X_1) \sim \pi(X_0, X_1)\),满足边缘约束\(p(x) = \sum_{y \in \mathcal{D}} \pi(x,y)\),\(q(y) = \sum_{x \in \mathcal{D}} \pi(x,y)\)。作为特例,训练对\(X_0\)和\(X_1\)可独立采样:\((X_0, X_1) \sim p(X_0) q(X_1)\)。
源分布\(p\)的常见实例化包括:
(i) 添加通常称为*mask*的特殊token值(此处记为\(m\))。这使用扩大的词汇表\(\mathcal{V}_{\mathrm{mask}} = [V] \cup \{m\}\),除非\(m\)已包含在词汇表中,否则严格限于\([V]^L\)设置之外。源几乎必然为\(X_0 = (m, \dots, m)\),且在所选耦合下\(X_1 \sim q\)。
(ii) 使用\(\mathcal{D}\)上的均匀分布,等价于独立地以等概率从\([V]\)中抽取每个\(x^i\),记为\(p_u(x^i)\)。
#### 2.1.4 连续流
设\(\tilde{\pi}\)为\(\mathbb{R}^{LV} \times \mathbb{R}^{LV}\)上的概率测度,其第一和第二边缘为\(\tilde{p}_0\)和\(\tilde{p}_1\)。我们称\(\tilde{p}_0\)为连续源,\(\tilde{p}_1\)为连续目标。此测度表示法在本设置中重要,因为目标可能支撑于独热向量上,因此不一定具有勒贝格密度。
对于非递减插值系数\(\tilde{k}_t: [0,1] \to [0,1]\),满足\(\tilde{k}_0 = 0\)且\(\tilde{k}_1 = 1\),定义:
\[
T_t(z_0, z_1) = (1 - \tilde{k}_t) z_0 + \tilde{k}_t z_1.
\tag{8}
\]
连续流为推前\(\tilde{p}_t = (T_t)_{\#} \tilde{\pi}\)。
\[
\tilde{p}_t = (T_t)_{\#} \tilde{\pi}.
\tag{9}
\]
等价地,条件于耦合端点对\((z_0, z_1)\),轨迹是确定的且具有形式:
\[
z_t = (1 - \tilde{k}_t) z_0 + \tilde{k}_t z_1.
\tag{10}
\]
这些是具有凸插值器的连续流:条件轨迹是耦合端点之间的直线段,可能通过\(\tilde{k}_t\)进行时间重参数化。当讨论经典连续速度场时,我们进一步假设\(\tilde{k}\)绝对连续,故几乎处处可微。
#### 2.1.5 扩散对偶性
Sahoo等人(2025)证明,均匀状态离散扩散过程可实现为底层高斯扩散的argmax投影。此观点下,连续潜在过程在欧几里得空间中演化,而观测到的分类状态通过对每个词汇块应用argmax获得。这使得将连续扩散思想迁移到离散生成成为可能,包括低方差训练课程和一致性蒸馏。
该结果激励了本文研究的问题:对于比扩散噪声过程更一般的、具有凸插值器的连续流,是否存在类似的投影原理。相似文章
MeshFlow: 基于等变流匹配的网格生成
MeshFlow 引入了一种等变最优传输流匹配模型,用于直接生成三角形网格,在达到最先进质量的同时,相比自回归方法提供了约18倍的推理加速。
几何感知的图像流匹配
本文提出用于自然图像的几何感知流匹配方法,将图像视为超球面上的点,并提出了SOT-CFM和SFM方法,通过利用图像数据的球面结构来改进生成建模。
用于等变图生成的Gromov-Monge流匹配
本文介绍了用于等变图生成的Gromov-Monge流匹配,通过与标准架构兼容的结构感知耦合来提高样本质量。
扩散和流匹配背后的几何:Wasserstein空间中的梯度流和测地线
本文揭示了扩散模型和流匹配是同一Wasserstein几何的两面:扩散遵循自由能梯度流(初值问题),而流匹配遵循Wasserstein测地线(边值问题),它们通过JKO格式统一起来。
PolyFlow:面向艺术家风格网格生成的连续拓扑嵌入流匹配
PolyFlow利用拓扑嵌入器提出连续的网格表示,并基于Transformer实现流匹配的并行网格生成,相比自回归方法推理速度更快且分辨率控制精确。