用于少步生成的潜核离散流映射
摘要
本文介绍了潜核离散流映射(LKF),一种用于离散扩散模型的流映射核,通过共享潜变量捕捉位置之间的相关性,无需蒸馏即可实现少步生成,并改善了文本生成的困惑度。
arXiv:2607.27529v1 公告类型:新
摘要:离散扩散和流匹配模型通过多步对序列进行去噪,但为了保持每一步的计算成本低廉,它们将转移过程按位置分解,并独立决定每个词元。这使得当目标需要关联两个位置(例如必须一致的主语和动词)时,文本的少步生成变得困难。独立更新会分别处理它们,从而花费大量函数评估来修复不匹配。现有的少步方法通过蒸馏或校正一个慢速教师模型来弥补丢失的相关性,因此继承了教师模型的质量上限。我们转而探究模型能否原生表达相关步骤,并给出了答案:潜核离散流映射(LKF),一种从头构建的流映射核,它是由 M 个因子化分量混合而成,并通过一个共享潜变量连接。在给定潜变量的条件下,每个分量是廉价的,而对于较小的 M,混合过程可以在闭式下对潜变量求和。我们证明,单步即可将质量置于相关补全上,且采样时间复杂度与因子化模型相同,因为每个序列只需抽取一个潜变量,并在整个去噪轨迹中重复使用。我们还证明了掩码扩散语言模型(MDLM)是 LKF 模型在 M=1 时的特例。在 One-Billion-Word(LM1B)和 WikiText-103 基准上的无条件文本生成实验表明,我们的 LKF 模型学习了强异质性分量,并且在生成困惑度上比似然基线提升了 2.1 倍到 3.3 倍,同时不损失多样性。增益随 M 增大而增加,在 M=8 时,它超越了蒸馏和校正的少步采样器。源代码可在以下网址获取:https://github.com/mansoor181/lkf.git
查看缓存全文
缓存时间: 2026/07/31 10:03
# 潜在核离散流映射用于少步生成
Mansoor Ahmed1,2\*通讯作者, Yue\-Tsz Fan2, Hemanth Venkateswara1, Murray Patterson1\*通讯作者
###### 摘要
离散扩散模型和流匹配模型需要经过很多步才能对序列去噪,但为了让每一步保持廉价,它们将转移过程按位置因子化,并独立地决定每个词元。当目标需要耦合两个位置时——例如必须保持数一致的主语和动词——这种独立性使得少步生成变得困难。独立更新会分别对它们做出承诺,许多函数评估被用于修复不一致。现有的少步方法通过蒸馏或矫正一个缓慢的教师模型来买回丢失的相关性,因此继承了教师模型的质量上限。我们转而问:模型能否原生地表达相关步骤?我们的答案是**Latent\-Kernel 离散流映射(Latent\-Kernel Discrete Flow Maps,LKF)**——一个从零训练的流映射核,它是 $M$ 个由单一共享潜在变量绑定的因子化分量的混合。在给定潜在变量的条件下,每个分量是廉价的,并且对于较小的 $M$,该混合可以闭式地对潜在变量求和。我们证明,单步就能将质量放在相关补全上,且采样时间复杂度与因子化模型相同,因为每个序列只抽取一个潜在变量,并在整个去噪轨迹中重复使用。我们还证明,掩码扩散语言模型(Masked Diffusion Language Model,MDLM)是我们在 $M=1$ 时 LKF 模型的特例。在 One\-Billion\-Word(LM1B)和 WikiText\-103 基准上的无条件文本生成实验表明,我们的 LKF 模型学到了强烈异质的分量,并将生成困惑度相对于似然基线提升了 $2.1\times$ 到 $3.3\times$,且没有损失多样性。增益随 $M$ 增大而增大,在 $M=8$ 时,它超过了蒸馏和矫正的少步采样器。源代码可在以下网址获取:https://github.com/mansoor181/lkf.git
## 1 引言
离散扩散模型和流匹配模型现在可以与自回归语言模型相媲美,因为它们并行填充序列中的每个位置,而不是一次一个词元([Potaptchik 等人,2026](https://arxiv.org/html/2607.27529#bib.bib20))。为了让单步去噪保持廉价,它们将每步转移按位置因子化:
$p_{t\to s}(x_s \mid x_t) = \prod_{i=1}^{L} p_i(x_s^i \mid x_t)$,(1)
并在给定当前序列 $x_t$ 时独立地决定每个词元([Sahoo 等人,2024](https://arxiv.org/html/2607.27529#bib.bib21))。这种独立性是单步廉价的原因,也是当目标需要耦合必须一起决定的位置时少步生成变得困难的原因。如果一个句子将主语与必须保持数一致的动词配对,或者将左括号与其匹配的右括号配对,那么正确的词元是相关的,而独立更新会分别对它们做出承诺。因子化步可能匹配单个词元的边缘分布,同时将大量概率分配给联合不一致的组合,因此可能需要额外的去噪步骤来解决这种不匹配。
**图 1:** 两个被掩码的词元必须在数上保持一致,因此它们的正确补全相互关联。(a) 因子化转移(式 (1))从 .5/.5 的边缘分布中独立采样两个位置。其外积联合分布对每个补全赋予 $1/4$ 的概率,因此只有一半质量落在一致结果上。(b) 当 $M=2$ 时,LKF 转移(式 (2))抽取一个共享潜在变量 $k\sim w(\cdot\mid x_t,t,s)$。在给定 $k$ 的条件下,各位置仍然独立,但每个分量集中于一种一致的补全。对 $k$ 取边缘化保持了与 (a) 中相同的逐位置边缘分布,同时将所有联合质量置于一致集合上。因此,两个秩一分量在一步转移中表达了相关补全。
(a) 因子化转移(其他方法)
The \[Mask1\] \[Mask2\] loudly.
dog .5||dogs .5
barks .5||bark .5
独立抽取
dog barks ✓ 1/4
dog bark ✗ 1/4
dogs barks ✗ 1/4
dogs bark ✓ 1/4
一次因子化抽取中 P(一致)=1/2
一半的联合质量不一致
(b) LKF 转移(我们的方法),$M=2$
The \[Mask1\] \[Mask2\] loudly.
k=1:单数 $w_1=.5$
k=2:复数 $w_2=.5$
$k\sim w(x_t)$,只抽取一次
dog 1·barks 1
dogs 1·bark 1
dog barks ✓ 1/2
dogs bark ✓ 1/2
一次转移中 P(一致)=1
目前,两个模型家族主导着这一权衡。**似然模型**,如 MDLM([Sahoo 等人,2024](https://arxiv.org/html/2607.27529#bib.bib21))和 SEDD([Lou 等人,2023](https://arxiv.org/html/2607.27529#bib.bib22)),从零训练一个强大的因子化去噪器,然后在推理时花费许多步,而正是在这个阶段,因子化假设的伤害最小。**少步加速器**则取一个训练好的教师模型,将其多步行为压缩为少数几步,要么通过**蒸馏**(Di4C([Hayakawa 等人,2024](https://arxiv.org/html/2607.27529#bib.bib19))、SDTT([Deschenaux and Gulcehre 2025](https://arxiv.org/html/2607.27529#bib.bib23))),要么通过**耦合矫正**(ReDi([Yoo 等人,2026](https://arxiv.org/html/2607.27529#bib.bib18)))。这两种方法都有效,但它们继承了教师模型的质量上限。众所周知,学生无法超越它所模仿的教师([Zhang 等人,2025](https://arxiv.org/html/2607.27529#bib.bib39)),而矫正经过几轮后也会退化。因此,这两个家族都没有从根源上消除因子化。我们问:能否在没有教师的情况下原生地建模相关步骤?我们的答案是 **Latent\-Kernel 离散流映射(LKF)**,其有限时间核是 $M$ 个由潜在变量 $k\in[M]$ 选择的因子化分量的混合:
$\Psi^\theta_{t\to s}(x_s \mid x_t) = \sum_{k=1}^{M} w^\theta_k(x_t,t,s) \prod_{i=1}^{L} P^\相似文章
FlowLM: 基于扩散-流适配的少步语言建模
FlowLM 提出了一种流匹配语言模型,通过高效微调从预训练扩散模型衍生而来,能够实现高质量少步文本生成,其效果可与2000步扩散采样相媲美,而训练轮次更少。
Discrete MeanFlow: 通过条件转移核实现一步生成
介绍了Discrete MeanFlow,一种通过在离散状态空间中学习连续时间马尔可夫链的条件转移核来实现一步生成的方法,避免了迭代去噪。
Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习
提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
语言生成作为最优控制:潜在控制空间中的闭环扩散
本文将语言生成重新表述为随机最优控制问题,解决了自回归和扩散模型的局限性,并提出了使用Flow Matching在潜在控制空间中的闭环扩散方法,实现了高保真生成和高效并行采样。