从接口到推理:从任意顺序模型引出任意顺序推理
摘要
本文识别了掩码扩散模型中任意顺序预测接口与实际任意顺序推理之间的差距,提出了基于插入和基于潜在空间的掩码扩散方法,以实现代码生成等任务中的真正任意顺序推理。作者训练了用于Python的7B FlexMDM和125M LatentMDM,展示了性能的提升。
arXiv:2607.26504v1 公告类型: 新
摘要:许多离散推理任务,如代码生成,本质上是非因果的:程序员在高层次结构和局部细节之间来回切换,我们将这一过程称为任意顺序推理。对于自回归语言模型,由于缺乏原生任意顺序接口,诸如填充和下一编辑预测等非因果能力需要手动设计的机制。我们能否设计出原生支持任意顺序推理的模型?掩码扩散模型最近成为有吸引力的候选者,因为它们的任意顺序训练目标自然提供了任意顺序预测接口。然而,该接口并不会自动产生任意顺序推理。我们证明了这种接口-推理差距源于位置不确定性:固定画布上的token级模型可能知道应该出现什么语义成分,但不知道将其放置在何处。鉴于此,我们提出了两种互补方法:(1) 基于插入的掩码扩散,建立在FlexMDM (Kim等人, 2025)基础上,通过插入来放松固定位置的约束,从而实现非连续区域的生成。(2) 潜在空间掩码扩散,将预测转移到更粗糙的语义片段上,从而实现对潜在生成顺序的搜索。实验上,我们训练了用于Python编码的7B FlexMDM和用于GSM8K的125M LatentMDM,并表明两种方法都引入了不同的任意顺序推理行为,并提升了下游性能。我们发布代码库于 https://github.com/SeunggeunKimkr/genuine-any-order。
查看缓存全文
缓存时间: 2026/07/30 09:59
# 从接口到推理:从任意顺序模型中引出任意顺序推理
来源:https://arxiv.org/html/2607.26504
Seunggeun Kim¹⋆ Jaeyeon Kim²⋆ Taekyun Lee¹⋆ Yuyuan Chen²⋆ Yilun Du² Sham Kakade² Sitan Chen²
¹德州大学奥斯汀分校,²哈佛大学,⋆共同第一作者
###### 摘要
许多离散推理任务(如代码生成)本质上是非因果的:程序员在高层次结构与局部细节之间来回切换,我们将这一过程称为*任意顺序推理*。对于自回归语言模型而言,它们本身缺乏任意顺序接口,因此填充(infilling)和下一编辑预测(next-edit prediction)等非因果能力需要手工设计的机制。我们能否设计出原生支持任意顺序推理的模型?掩码扩散模型(Masked Diffusion Models)最近成为有希望的候选者,因为其任意顺序训练目标自然提供了任意顺序预测接口。然而,这种*接口*并不会自动产生任意顺序*推理*。我们证明,这种接口-推理差距源于*位置不确定性*:固定画布上的词元级模型可能知道下一个应出现的*语义组件是什么*,但不知道*将其放在何处*。基于此,我们提出两种互补方法:(1)*基于插入的掩码扩散*,建立在FlexMDM(Kim et al., 2025a (https://arxiv.org/html/2607.26504#bib.bib14))之上,通过插入操作放松固定位置约束,使得生成能够跨越非连续区域。(2)*潜在空间掩码扩散*,将预测转移到更粗粒度的语义片段上,从而在潜在生成顺序上进行搜索。实验方面,我们训练了一个用于Python编码的7B FlexMDM和一个用于GSM8K的125M LatentMDM,结果表明两种方法都能引发不同的任意顺序推理行为,并提升下游性能。我们已将代码库发布在https://github.com/SeunggeunKimkr/genuine-any-order。
参照图注
图1:本文工作的示意性概述。掩码扩散模型由于在词元级别操作固定画布,无法实现真正的*任意顺序*推理。我们证明,基于插入的掩码扩散和潜在空间掩码扩散模型克服了这一局限,实现了真正的*任意顺序*推理。
## 1 引言
许多现实世界中的离散推理任务本质上是非因果的:当人类构建代码等复杂离散对象时,他们会修正先前的决定、插入遗漏的部分,并在展开高层次结构与填充局部细节之间交替。自回归语言模型是离散生成建模的主流范式,它们从左到右解码,因此本身不支持这样的生成轨迹。尽管如此,已有大量工作通过非因果机制(如填充(Bavarian et al., 2022 (https://arxiv.org/html/2607.26504#bib.bib96))、重排序(Shah et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib98))和下一编辑预测(Lu et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib99)))来扩展它们。虽然这表明任意顺序推理是一种理想能力,但这些方法任务特定的性质促使我们寻找更原生、更原则性的生成范式。我们聚焦于掩码扩散模型(MDMs)(Shi et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib5); Sahoo et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib16)),这是扩散语言模型(Nie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib12); Xie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib11); Gong et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib3); Bie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib26))中一种流行的实例化。MDMs是任意顺序推理的自然候选者,因为它们的训练目标赋予其任意顺序预测*接口*(Ou et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib9); Zheng et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib10); Kim et al., 2025c (https://arxiv.org/html/2607.26504#bib.bib15)):给定一个部分掩码的序列,它们可以在任意掩码位置预测干净词元。这种接口使得任意顺序推理在原则上成为可能,但并非自动实现:解码策略仍然必须在每一步选择要揭示哪些位置,而糟糕的选择可能使生成顺序回到从左到右完成的方式。因此,我们询问MDMs是否真的兑现了这一承诺:*任意顺序预测接口能否产生真正具有任意顺序特性的推理?*
**我们的贡献。** 在这项工作中,我们聚焦于代码生成,这是一个自然受益于真正任意顺序推理的领域。我们的第一个发现是负面的。我们表明,在基于置信度的解码(提高下游性能的主流推理策略)下,MDMs生成的代码在*算法上接近*它们通过严格从左到右解码生成的结果(第3.1节 (https://arxiv.org/html/2607.26504#S3.SS1))。这与最近关于*因果坍缩*(Ni et al., 2026 (https://arxiv.org/html/2607.26504#bib.bib43); Gong et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib3); Li et al., 2026 (https://arxiv.org/html/2607.26504#bib.bib41))的观察相呼应,但我们识别出这一现象背后更根本的瓶颈:*位置不确定性*。当模型知道下一个应生成的*语义组件是什么*,但对*将其放在何处*仍不确定时,就会出现位置不确定性:其概率质量分散在固定掩码画布上的多个可能位置。由于基于置信度的解掩码是对单个位置进行排序,这些全局有意义但*位置分散*的组件看起来不如局部确定的延续那么自信,从而将解码推回从左到右的完成方式。这些发现(第3.2节 (https://arxiv.org/html/2607.26504#S3.SS2))表明,掩码扩散模型的任意顺序训练目标本身并不能保证真正的任意顺序推理。这激发了一个更广泛的问题:什么样的生成模型能够实现真正的任意顺序推理?在这项工作中,我们提出两种互补的补救措施,每种都以不同方式规避位置不确定性,并引发*不同形式的任意顺序推理*。
我们的第一个解决方案,*基于插入的掩码扩散*(第4.1节 (https://arxiv.org/html/2607.26504#S4.SS1)),建立在FlexMDM(Kim et al., 2025a (https://arxiv.org/html/2607.26504#bib.bib14))之上,它为MDMs增加了插入词元的能力。这规避了固定画布的瓶颈:解掩码不再将一个词元提交到某个特定的最终位置,因为后续的插入可以改变其在最终序列中的位置。在这种词元提交负担减轻的情况下,我们证明FlexMDM产生了一种结构性的任意顺序推理形式:在解析后的程序树中,生成*在不同节点之间来回移动*,而不是一次完成一个连续区域。实验上,我们通过显著扩展Kim et al. (2025a (https://arxiv.org/html/2607.26504#bib.bib14))的实际范围实现了这一点:我们将Dream-Coder 7B(Xie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib11))微调成一个通用的Python代码生成FlexMDM,在HumanEval和HumanEval+(Chen et al., 2021 (https://arxiv.org/html/2607.26504#bib.bib23))上的Pass@16指标上优于Dream-Coder 7B,在MBPP和MBPP+(Austin et al., 2021 (https://arxiv.org/html/2607.26504#bib.bib24))上的Pass@1指标上也超过它,同时整体表现持平。
我们的第二个解决方案,*潜在空间掩码扩散*(LatentMDM)(第4.2节 (https://arxiv.org/html/2607.26504#S4.SS2)),通过将掩码扩散从词元空间转移到连续潜在空间来克服位置不确定性。LatentMDM与先前基于嵌入空间的方法(如流映射语言模型(Lee et al., 2026 (https://arxiv.org/html/2607.26504#bib.bib77)))不同,是我们的主要建模贡献。该模型不是选择单个词元位置,而是决定下一个要解码的掩码潜在片段,将接口转移到更粗粒度的语义粒度上。这实现了一种不同形式的任意顺序推理:*在潜在空间中搜索语义生成顺序*,使模型能够发现从左到右词元顺序之外的排序。与FlexMDM不同,LatentMDM没有现成的预训练基础模型。因此,我们在TinyGSM(Liu et al., 2023 (https://arxiv.org/html/2607.26504#bib.bib64))上预训练了一个125M参数的潜在掩码扩散模型,并表明它在相同推理预算下优于标准MDM、嵌入空间模型(如DUO(Sahoo et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib80))和S\mathbb{S}-FLM(Deschenaux and Gulcehre, 2026 (https://arxiv.org/html/2607.26504#bib.bib59))),甚至优于带有KV缓存的自回归模型。
## 2 预备知识
本节回顾掩码扩散模型(MDMs)(Shi et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib5); Sahoo et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib16))。
**记号。** 假设我们的目标是学习从数据分布 \(\mathbf{x} \sim p_{\mathrm{data}}\) 中生成样本,这些样本是长度为 \(L\) 的离散序列,词汇表 \(\mathcal{V}\) 有限。令 \(\mathbf{x}^i\) 表示给定序列 \(\mathbf{x} = (x^1, \dots, x^L)\) 的第 \(i\) 个元素,\(\Delta(\mathcal{V})\) 表示 \(\mathcal{V}\) 上概率分布的单纯形。
**训练。** 尽管MDMs有多种解释,我们采用*任意顺序*语言模型的解释(Ou et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib9); Zheng et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib10)),这简化了MDM之前的表述(Sahoo et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib16); Shi et al., 2024 (https://arxiv.org/html/2607.26504#bib.bib5))。粗略地说,MDMs引入一个辅助掩码词元 \(\mathbf{m}\),并学习在给定掩码序列条件下,每个掩码位置干净词元的后验边缘分布。为了在训练中学习这个后验,我们抽取一个干净序列 \(\mathbf{x} \sim p_{\mathrm{data}}\),并按如下方式构建部分掩码序列 \(\mathbf{z}\):采样 \(n \sim \mathrm{Unif}\{0, \dots, L\}\),并将 \(\mathbf{x}\) 中均匀选择的 \(n\) 个索引处的词元替换为 \(\mathbf{m}\)。因此,得到的 \(\mathbf{z}\) 有 \(n\) 个(随机抽取的)掩码索引。这个掩码过程诱导出 \((\mathbf{x}, \mathbf{z})\) 上的联合分布,我们将条件边缘分布 \(\mathrm{law}(\mathbf{x}^i \mid \mathbf{z})\) 称为*解掩码后验*。这个解掩码后验是MDMs的核心对象,由神经网络 \(f_\theta\) 建模,该网络以 \(\mathbf{z}\) 为输入,输出一个 \(|\mathcal{V}| \times L\) 的矩阵。具体来说,其第 \(i\) 列 \(f_\theta^i(\cdot \mid \mathbf{z}) \in \Delta(\mathcal{V})\) 建模解掩码后验 \(f_\theta^i(v \mid \mathbf{z}) \approx p(\mathbf{x}^i = v \mid \mathbf{z})\)。为了训练 \(f_\theta\),我们最小化所有掩码索引上的交叉熵损失之和:
\[
\mathcal{L}(\theta) := \mathbb{E}_{\mathbf{x}, \mathbf{z}} \left[ \frac{1}{n} \sum_{i: \mathbf{z}^i = \mathbf{m}} -\log f_\theta^i(\mathbf{x}^i \mid \mathbf{z}) \right].
\]
**MDM推理。** MDM的一个关键特性是其*任意顺序目标*:预训练的MDM已学会预测序列中*任意掩码位置*的后验。这种任意顺序性质建立在早期掩码语言模型工作之上(Devlin et al., 2019 (https://arxiv.org/html/2607.26504#bib.bib8); Ghazvininejad et al., 2019 (https://arxiv.org/html/2607.26504#bib.bib66); Wang and Cho, 2019 (https://arxiv.org/html/2607.26504#bib.bib67))。接下来,我们解释这种任意顺序性质如何转化为推理时的灵活性。MDM推理从一个全掩码序列 \(\mathbf{x}_1 = (\mathbf{m}, \dots, \mathbf{m})\) 开始,或者更一般地,给定一个提示 \(\mathbf{x}_1 = ([\texttt{prompt}], \mathbf{m}, \dots, \mathbf{m})\),并在一个单调递减的时间网格 \(t_0 = 1 > \dots > t_N = 0\) 上进行。在每一步 \(t_\ell\),给定部分掩码序列 \(\mathbf{x}_{t_\ell} \in (\mathcal{V} \cup \{\mathbf{m}\})^L\),我们通过两步得到 \(\mathbf{x}_{t_{\ell+1}}\):(a) 选择掩码位置的一个子集 \(\mathcal{S} \subseteq \{i \mid \mathbf{x}_{t_\ell}^i = \mathbf{m}\}\),以及 (b) 对于每个 \(i \in \mathcal{S}\),将 \(\mathbf{x}_{t_\ell}^i\) 解掩码为一个干净词元 \(v\),采样自 \(v \sim f_\theta^i(\cdot \mid \mathbf{x}_{t_\ell}) \in \Delta(\mathcal{V})\)。值得注意的是,由于MDM训练是任意顺序的,即 \(f_\theta\) 预测所有掩码位置的干净词元分布,因此在选择 \(\mathcal{S}\) 时具有灵活性,这对下游性能至关重要。下面,我们描述实践中选择 \(\mathcal{S}\) 的几种策略。
无训练方法,包括 Zheng et al. (2024 (https://arxiv.org/html/2607.26504#bib.bib10)); Kim et al. (2025c (https://arxiv.org/html/2607.26504#bib.bib15)); Peng et al. (2025 (https://arxiv.org/html/2607.26504#bib.bib6)); Ben-Hamu et al. (2025 (https://arxiv.org/html/2607.26504#bib.bib21)); Nie et al. (2025 (https://arxiv.org/html/2607.26504#bib.bib12)); Wu et al. (2025b (https://arxiv.org/html/2607.26504#bib.bib29)); Hayakawa et al. (2025 (https://arxiv.org/html/2607.26504#bib.bib31)),通常首先为每个掩码位置计算一个置信度分数,并选择分数最高的位置集合 \(\mathcal{S}\),即 \(\mathcal{S} \leftarrow \mathrm{TopK}_{i: \mathbf{x}_t^i = \mathbf{m}} [\mathrm{score}(i)]\),其中 \(\mathrm{score}(i)\) 量化了模型在位置 \(i\) 的预测确定性。常用的 \(\mathrm{score}(i)\) 包括最大预测概率 \(\max_{v \in \mathcal{V}} f_\theta^i(v \mid \mathbf{x}_t)\)、前两个概率之间的间隔 \(f_\theta^i(v_1 \mid \mathbf{x}_t) - f_\theta^i(v_2 \mid \mathbf{x}_t)\)(其中 \(v_1, v_2\) 是具有最高预测概率的前两个词元)、以及类别分布的负熵。一些变体还引入了显式的位置相关偏置,倾向于最左侧位置,通常称为半自回归解码。我们将这一广泛的无训练规则家族称为*基于置信度的解码*。
**扩散大语言模型。** 在MDM出现之后,它们已从7B参数(Nie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib12); Ye et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib60); Xie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib11); Song et al., 2025b (https://arxiv.org/html/2607.26504#bib.bib50); Gong et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib3))有效扩展到100B(Bie et al., 2025 (https://arxiv.org/html/2607.26504#bib.bib26), 2026 (https://arxiv.org/html/2607.26504#bib.bib53))以及工业级规模(DeepMind, 2025 (https://arxiv相似文章
面向掩码扩散的自适应顺序策略
提出使用轻量级策略网络学习掩码扩散模型中的去掩码顺序,通过加权损失在组合任务和蛋白质设计上优于启发式方法。
双向归纳:掩码扩散语言模型中上下文学习的机制分析
本文对掩码扩散语言模型中的归纳机制进行了机制分析,识别出一个双向归纳电路,并表明这些模型将全局掩码标记比例用作隐式时间步。
通过填充提取扩散语言模型中的训练数据
本文介绍了infilling extraction(填充提取)方法,这是一种通过使用任意二进制掩码从扩散语言模型中提取训练数据的新方法,表明此类模型比之前认为的更容易受到记忆化攻击。
迷失在插值中:为什么预测性反馈在扩散语言模型中失效
本文分析了掩码扩散语言模型(MDLMs)的嵌入空间,发现其呈超球面几何结构,导致线性插值并非最优。作者引入了球面软掩码(S-SM),在超球面上使用SLERP和Fréchet均值,相较于之前的软掩码方法,在MAUVE和困惑度指标上均有提升。
强化多模态掩码扩散模型的生成顺序
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。