基于推测解码的无分解错误离散扩散语言模型
摘要
本文提出了FeF-DLLM,一种通过精确前缀条件分解消除分解错误、并利用推测解码加速推理的离散扩散语言模型,在GSM8K和MATH等基准测试中显著提升了准确率和速度。
arXiv:2605.14305v1 公告类型:新论文
摘要:离散扩散语言模型通过并行词元预测提高了生成效率,但标准$X_0$预测方法采用独立的词元级分布来近似干净词元后验,从而引入了分解错误。本文提出了无分解错误离散扩散语言建模(FeF-DLLM),该方法用干净后验的精确前缀条件分解替代独立的干净词元预测,以更好地保留词元依赖关系。为了降低前缀条件化带来的顺序计算开销,FeF-DLLM进一步在扩散去噪过程中引入推测解码,在保持离散扩散语言模型并行预测和重掩码特性的同时加速推理。理论上,我们证明了FeF-DLLM从真实联合分布中生成,并推导了其预期的加速比。在GSM8K、MATH、HumanEval和MBPP上的实验表明,我们的方法在平均准确率上提升了5.04个百分点,同时平均推理速度提升了$3.86\times$。
查看缓存全文
缓存时间: 2026/05/15 06:21
# 基于推测解码的无因子化错误的离散扩散语言模型 来源:https://arxiv.org/html/2605.14305 ††footnotetext:作者对本文贡献均等,按字母顺序排列。Xun Fang 华东师范大学 [email protected] &Yunchen Li 华东师范大学 [email protected] &Hang Yuan 华东师范大学 北京中关村学院 [email protected] &Zhou Yu 华东师范大学 [email protected] ###### 摘要 离散扩散语言模型通过并行 token 预测提高生成效率,但标准 X0X_{0} 预测方法通过独立 token 级分布近似干净 token 后验,引入了因子化错误。本文提出无因子化错误的离散扩散语言建模 (FeF-DLLM),它用干净后验的精确前缀条件化分解替代独立的干净 token 预测,以更好地保持 token 间的依赖关系。为降低前缀条件化引入的顺序计算开销,FeF-DLLM 进一步在扩散去噪中融入推测解码,在加速推理的同时保留 DLLM 的并行预测和重遮盖属性。理论上,我们证明 FeF-DLLM 能从真实的联合分布中生成样本,并推导其预期的加速比。在 GSM8K、MATH、HumanEval 和 MBPP 上的实验表明,我们的方法平均提升了 5.04 个百分点的准确率,同时实现了平均 3.86×3.86× 的推理加速。 ## 1 引言 扩散模型 (Ho 等,2020 (https://arxiv.org/html/2605.14305#bib.bib7);Lipman 等,2022 (https://arxiv.org/html/2605.14305#bib.bib31);Song 等,2020b (https://arxiv.org/html/2605.14305#bib.bib32), a (https://arxiv.org/html/2605.14305#bib.bib45)) 近年来已成为最成功的生成模型类别之一,在图像生成 (Rombach 等,2022 (https://arxiv.org/html/2605.14305#bib.bib48);Peebles 和 Xie,2023 (https://arxiv.org/html/2605.14305#bib.bib41);Ma 等,2024 (https://arxiv.org/html/2605.14305#bib.bib49))、视频生成 (Ho 等,2022 (https://arxiv.org/html/2605.14305#bib.bib38);Bar-Tal 等,2024 (https://arxiv.org/html/2605.14305#bib.bib39)) 以及许多其他领域 (Wu 等,2024 (https://arxiv.org/html/2605.14305#bib.bib50);Yim 等,2024 (https://arxiv.org/html/2605.14305#bib.bib51);Wang 等,2025 (https://arxiv.org/html/2605.14305#bib.bib52)) 中表现出色。最近,一些工作将扩散建模扩展到离散空间 (Austin 等,2021a (https://arxiv.org/html/2605.14305#bib.bib9);Lou 等,2024 (https://arxiv.org/html/2605.14305#bib.bib12);Gat 等,2024 (https://arxiv.org/html/2605.14305#bib.bib47);Sahoo 等,2024 (https://arxiv.org/html/2605.14305#bib.bib13)),并将离散扩散语言模型 (DLLM) 应用于大型语言建模 (Nie 等,2025 (https://arxiv.org/html/2605.14305#bib.bib15);Ye 等,2025 (https://arxiv.org/html/2605.14305#bib.bib46);Bie 等,2025 (https://arxiv.org/html/2605.14305#bib.bib43))。这些模型在展示出与自回归模型竞争性能的同时,实现了基于迭代去噪和并行 token 预测的不同生成范式。在生成过程中,DLLM 通常并行预测多个 token,并将这些 token 级别的预测组合成最终输出。虽然这种设计提高了生成效率,但它引入了一个因子化错误,因为干净 token 的联合分布被近似为独立 token 分布的乘积。近期工作试图从不同角度解决这个问题。ReDi (Yoo 等,2025 (https://arxiv.org/html/2605.14305#bib.bib35)) 通过整流流公式和新构建的配对训练数据缓解了因子化错误,但并未完全消除它。其他方法提出了改进的采样过程 (Liu 等,2024 (https://arxiv.org/html/2605.14305#bib.bib33);Lavenant 和 Zanella,2025 (https://arxiv.org/html/2605.14305#bib.bib37)),但通常以显著降低生成速度为代价。一些方法将 DLLM 与推测解码集成 (Campbell 等,2025 (https://arxiv.org/html/2605.14305#bib.bib34);Cheng 等,2025 (https://arxiv.org/html/2605.14305#bib.bib36));然而,这种设计将自回归解码行为引入 DLLM 推理,从而破坏了 DLLM 特有的非自回归推理特性。在本文中,我们提出*无因子化错误的离散扩散语言建模* (FeF-DLLM)。基于经典的 X0X_{0} 预测框架,FeF-DLLM 分析了干净后验分布的精确分解,并推导出一个无因子化错误的生成目标。我们的方法不是独立预测每个干净 token,而是使用前缀条件化预测来保持干净 token 间的依赖关系。为提高推理效率,我们进一步引入推测解码,它分摊了前缀条件化引入的顺序依赖,并在加速生成的同时保留 DLLM 的并行预测和重遮盖属性。我们理论上证明,当位置条件化的目标模型得到良好指定时,FeF-DLLM 能从真实的条件联合分布中生成样本,并分析了推测解码带来的预期加速。我们在标准数学推理和代码生成基准上评估 FeF-DLLM,包括 GSM8K、MATH、HumanEval 和 MBPP。实验结果表明,FeF-DLLM 平均提升了 5.04 个百分点的准确率,并实现了平均 3.86×3.86× 的推理加速,展示了其在提高生成质量的同时显著加速推理的有效性。我们的贡献总结如下: - • 我们分析了现有 DLLM 中的因子化错误,并展示了通过干净后验的精确前缀条件化分解可以消除该错误。 - • 我们使用推测解码来加速由此产生的前缀条件化推理过程,并推导了其预期加速比。 - • 我们进行大量实验来评估 FeF-DLLM。实验结果表明,FeF-DLLM 在生成质量上持续优于基线,同时实现了显著的时钟时间加速。 ## 2 预备知识 ### 2.1 离散扩散语言模型 离散扩散语言模型直接在离散 token 上定义扩散过程。基于 D3PM 框架 (Austin 等,2021a (https://arxiv.org/html/2605.14305#bib.bib9)),我们将前向扩散过程定义为固定的马尔可夫链 q(X1:T∣X0)=∏t=1Tq(Xt∣Xt−1)q(X_{1:T}\mid X_{0})=\prod_{t=1}^{T}q(X_{t}\mid X_{t-1}),其中每个转移核由分类转移矩阵 Qt∈RS×SQ_{t}\in\mathbb{R}^{S\times S} 参数化,SS 表示词汇表大小。对于一个独热 token Xt−1X_{t-1},单步损坏过程为 q(Xt∣Xt−1)=Cat(Xt;p=Xt−1Qt),q(X_{t}\mid X_{t-1})=\mathrm{Cat}(X_{t};\,p=X_{t-1}Q_{t}), 其中 Cat(x;p)\mathrm{Cat}(x;p) 表示在独热行向量 xx 上的分类分布,概率由行向量 pp 给出。令 Q ̄t=Q1Q2⋯Qt\bar{Q}_{t}=Q_{1}Q_{2}\cdots Q_{t}。在时间步 tt 的边缘分布为 q(Xt∣X0)=Cat(Xt;p=X0Q ̄t)q(X_{t}\mid X_{0})=\mathrm{Cat}(X_{t};\,p=X_{0}\bar{Q}_{t}),从而可以直接从干净输入中采样噪声 token。对于序列数据,损坏通常独立地应用于各个 token 位置。常见的 QtQ_{t} 选择包括均匀转移、嵌入空间中的最近邻转移以及吸收态转移(逐渐用特殊的 [MASK][\mathrm{MASK}] token 替换 token)。前向后验具有如下闭合形式: q(Xt−1∣Xt,X0)=Cat(Xt−1;p=XtQt⊤⊙X0Q ̄t−1X0Q ̄tXt⊤).q(X_{t-1}\mid X_{t},X_{0})=\mathrm{Cat}\left(X_{t-1};p=\frac{X_{t}Q_{t}^{\top}\odot X_{0}\bar{Q}_{t-1}}{X_{0}\bar{Q}_{t}X_{t}^{\top}}\right).生成过程是一个学习的反向马尔可夫链 pθ(X0:T)=p(XT)∏t=1Tpθ(Xt−1∣Xt)p_{\theta}(X_{0:T})=p(X_{T})\prod_{t=1}^{T}p_{\theta}(X_{t-1}\mid X_{t})。在 X0X_{0} 预测参数化中,模型首先从损坏输入预测干净 token,记为 X^0=fθ(Xt,t)\hat{X}_{0}=f_{\theta}(X_{t},t)。然后通过将该预测代入分析前向后验来构建反向转移: pθ(Xt−1∣Xt)=q(Xt−1∣Xt,X^0).p_{\theta}(X_{t-1}\mid X_{t})=q(X_{t-1}\mid X_{t},\hat{X}_{0}). (1) 等价地,模型使用预测的干净 token 来确定如何对 XtX_{t} 进行一步去噪。相应的干净 token 预测目标为 L=Eq(X0)EtEq(Xt∣X0)[−∑i=1Nlogpθ(X0i∣Xt,t)].\mathcal{L}=\mathbb{E}_{q({X}_{0})}\mathbb{E}_{t}\mathbb{E}_{q(X_{t}\mid X_{0})}\left[-\sum_{i=1}^{N}\log p_{\theta}(X_{0}^{i}\mid X_{t},t)\right]. (2) ### 2.2 推测解码 推测解码 (Leviathan 等,2023 (https://arxiv.org/html/2605.14305#bib.bib6);Chen 等,2023 (https://arxiv.org/html/2605.14305#bib.bib53)) 通过使用更小更快的近似模型提出多个候选 token,然后由目标模型并行验证,从而加速自回归推理。令 MπM_{\pi} 表示目标模型,π(Xi∣X<i)\pi(X_{i}\mid X^{<i}) 表示在给定已生成前缀时预测第 ii 个 token 的条件分布。推测解码使用草稿模型 ρ\rho 快速生成 K 个候选 token,然后目标模型 π\pi 以并行方式验证这些候选。如果草稿 token 被接受,则生成过程向前推进多个 token;否则,可能从第 i+1 个 token 开始修订,甚至重新生成。通常,接受/拒绝标准基于逐个 token 的拒绝采样过程,以保证从真实目标分布 π\pi 中进行精确采样。在本文中,我们将推测解码的思想扩展到离散步扩散语言模型,以加速前缀条件化采样过程。 ## 3 方法论 ### 3.1 因子化错误分析 我们首先回顾离散扩散语言模型中常用的 X0X_{0} 预测参数化。给定一个损坏序列 XtX_{t},公式 1 中的反向转移是从干净数据后验 p(X0∣Xt)p(X_{0}\mid X_{t}) 的估计构建的。原则上,该后验是完整离散序列空间 Vd\mathcal{V}^{d} 上的分布,其基数随序列长度 dd 呈指数增长。直接对这样的联合分布进行建模对于神经语言模型来说在计算上是不可行的。因此,现有的 DLLM 通常采用 token 级预测目标,其中模型在给定相同损坏输入的情况下独立预测每个干净 token: p(X0∣Xt)≈∏i=1dp(X0i∣Xt).p(X_{0}\mid X_{t})\approx\prod_{i=1}^{d}p(X_{0}^{i}\mid X_{t}). (3) 然而,公式 3 依赖于跨维度的独立性假设。这种假设通常与自然语言不相容,因为自然语言中的 token 表现出强烈的句法和语义依赖关系。干净后验的精确分解遵循链式法则: p(X0∣Xt)=∏i=1dp(X0i∣Xt,X0<i).p(X_{0}\mid X_{t})=\prod_{i=1}^{d}p(X_{0}^{i}\mid X_{t},X_{0}^{<i}). (4) 比较公式 3 和公式 4,我们观察到因子化错误 pθ(Xt−1∣Xt)≈q(Xt−1∣Xt,X^0)p_{\theta}(X_{t-1}\mid X_{t})\approx q(X_{t-1}\mid X_{t},\hat{X}_{0}),其中 X^0\hat{X}_{0} 来自独立预测,而真实反向转移需要联合预测。由于 token 间依赖关系被忽略,现有的 DLLM 在采样过程中倾向于生成不一致的序列。 ### 3.2 无因子化错误的离散扩散建模 为解决上述错误,我们提出 FeF-DLLM,它通过使用公式 4 的精确链式分解来消除因子化错误。然而,由于序列长度可能很大,直接自回归地建模每个位置的后验在计算上是昂贵的。我们转而推导一个无需显式自回归建模的等价分解。具体地,我们使用以下引理来分解条件后验 p(X0i∣Xt,X0<i)p(X_{0}^{i}\mid X_{t},X_{0}^{<i}): **引理 1.** 对于任何位置 ii,条件后验 p(X0i∣Xt,X0<i)p(X_{0}^{i}\mid X_{t},X_{0}^{<i}) 等价于 p(X0i∣Xt≥i,X0<i,1[X0i]t)p(X_{0}^{i}\mid X_{t}^{\ge i},X_{0}^{<i},\mathbb{1}[X_{0}^{i}]_{t}),其中 Xt≥iX_{t}^{\ge i} 表示 XtX_{t} 从位置 ii 开始的后缀,1[X0i]t\mathbb{1}[X_{0}^{i}]_{t} 是指示函数,指示 X0iX_{0}^{i} 在时间步 tt 是否被遮盖(例如,对于吸收态扩散,如果 XtiX_{t}^{i} 是 [MASK] 则指示为 1;否则为 0)。 证明见附录。该引理表明,当将后缀 Xt≥iX_{t}^{\ge i} 和遮盖状态作为条件时,可以独立地预测每个位置。因此,我们将采样过程重新表述为:从 p(X0∣Xt)p(X_{0}\mid X_{t}) 中采样一个序列相当于为每个位置 ii 顺序采样 p(X0i∣Xt≥i,X0<i,1[X0i]t)p(X_{0}^{i}\mid X_{t}^{\ge i},X_{0}^{<i},\mathbb{1}[X_{0}^{i}]_{t})。这允许我们使用一个目标模型 πθ(X0i∣Xt,X0<i)\pi_{\theta}(X_{0}^{i}\mid X_{t},X_{0}^{<i}) 来预测每个位置,该模型以所有可用的先前干净 token 和损坏序列为条件。 ### 3.3 通过推测解码加速 直接使用公式表述中的顺序前缀条件化采样在计算上是昂贵的,因为它需要在去噪步骤之间进行顺序 token 预测。为了加速这一过程,我们利用推测解码。我们引入一个草稿模型 ρϕ(X0i∣Xt,X0<i)\rho_{\phi}(X_{0}^{i}\mid X_{t},X_{0}^{<i}),该模型更小、更快,用于提出多个候选 token,然后由目标模型 πθ\pi_{\theta} 验证。在扩散去噪的每一步,草稿模型从当前位置开始提议一个长度为 kk 的窗口。然后目标模型从左到右验证这些提议,保留接受的 token 并拒绝不匹配 token 之后的部分。由于目标模型以所有先前干净 token 为条件,验证过程可以并行计算窗口内的所有位置,因为条件依赖关系已经通过草稿提议得到满足。我们将推测解码集成到反向扩散过程中,称为 FeF-DLLM。算法 1 总结了完整的生成过程。 定理 2 (加速保证). 设草稿模型的平均接受率为 α\alpha,目标模型和草稿模型在非自回归设置中每步的成本均为 cπc_{\pi} 和 cρc_{\rho}。则 FeF-DLLM 的预期加速比 S=E[Ck]cπcρ+cπS = \frac{\mathbb{E}[C_{k}] c_{\pi}}{c_{\rho} + c_{\pi}},其中 CkC_{k} 是每轮推测提交的 token 数。如果 cρ≈cπc_{\rho} \approx c_{\pi},则 S≈E[Ck]/2S \approx \mathbb{E}[C_{k}]/2。 证明见附录。 ### 3.4 训练目标 我们以端到端的方式训练 FeF-DLLM。目标模型 πθ\pi_{\theta} 和草稿模型 ρϕ\rho_{\phi} 使用以下目标联合训练: LFeF = Eq(X0)EtEq(Xt∣X0)[−∑i=1d(log πθ(X0i∣Xt,X0<i) + λ log ρϕ(X0i∣Xt,X0<i))],\mathcal{L}_{\text{FeF}} = \mathbb{E}_{q(X_{0})} \mathbb{E}_{t} \mathbb{E}_{q(X_{t} \mid X_{0})} \left[ -\sum_{i=1}^{d} \left( \log \pi_{\theta}(X_{0}^{i} \mid X_{t}, X_{0}^{<i}) + \lambda \log \rho_{\phi}(X_{0}^{i} \mid X_{t}, X_{0}^{<i}) \right) \right], 其中 λ\lambda 是平衡两个模型损失的超参数。注意,在训练期间,前缀 X0<iX_{0}^{<i} 来自真实数据。在推理期间,前缀来自已接受的干净 token。草稿模型被训练为匹配目标模型的条件分布,使得其提议具有高精确度,从而最大化接受率。 ## 4 实验 ### 4.1 设置 **基准.** 我们在四个基准上评估 FeF-DLLM:GSM8K (数学推理)、MATH (数学推理)、HumanEval (代码生成) 和 MBPP (代码生成)。**基线.** 我们将 FeF-DLLM 与以下基线进行比较:标准 X0X_{0} 预测离散扩散语言模型 (Base-DLLM)、ReDi (一种整流流方法) 和 MDLM (一种掩码扩散语言模型)。我们还报告自回归模型的性能作为参考。**实现细节.** 我们使用一个 1.3B 参数的 transformer 作为目标模型,一个 300M 参数的 transformer 作为草稿模型。扩散过程使用吸收态损坏,词汇表大小 S=32000S=32000,序列长度 d=512d=512。推理时,草稿窗口大小 k=5k=5,λ=0.1\lambda=0.1。所有模型在 8 个 A100 GPU 上训练。 ### 4.2 主要结果 表 1 显示了主要结果。FeF-DLLM 在所有基准上一致优于基线。在 GSM8K 上,FeF-DLLM 达到 68.3% 的准确率,比 Base-DLLM (62.9%) 高出 5.4 个百分点,同时实现了 3.9 倍的推理加速。在 MATH 上,FeF-DLLM 达到 42.1% 的准确率,比 Base-DLLM (36.8%) 高出 5.3 个百分点。在 HumanEval 上,FeF-DLLM 达到 72.5% 的 pass@1,比 Base-DLLM (67.8%) 高出 4.7 个百分点。在 MBPP 上,FeF-DLLM 达到 66.1% 的准确率,比 Base-DLLM (61.3%) 高出 4.8 个百分点。平均而言,FeF-DLLM 提升了 5.04 个百分点的准确率,并实现了 3.86× 的推理加速。 | 方法 | GSM8K | MATH | HumanEval | MBPP | 平均加速 | |---|---|---|---|---|---| | 自回归 | 72.1% | 46.3% | 76.8% | 70.2% | 1.0× | | Base-DLLM | 62.9% | 36.8% | 67.8% | 61.3% | 1.0× | | ReDi | 65.4% | 39.2% | 70.1% | 63.5% | 1.1× | | MDLM | 64.1% | 38.5% | 69.2% | 62.4% | 0.9× | | FeF-DLLM (ours) | 68.3% | 42.1% | 72.5% | 66.1% | 3.86× | 表 1:主要结果。准确率 (GSM8K、MATH、MBPP) 或 pass@1 (HumanEval) 以及相对于 Base-DLLM 的推理加速。 ### 4.3 消融研究 **草稿窗口大小.** 图 1 (左) 显示了不同草稿窗口大小 kk 对加速的影响。随着 kk 增大,加速先增加后饱和,在 k=5k=5 附近达到峰值。**草稿模型大小.** 我们改变草稿模型大小 (100M、200M、300M、500M 参数)。图 1 (中) 显示更大更强的草稿模型在准确率 (略高) 和加速 (由于更大的 cρc_{\rho} 而略低) 之间存在 trade-off。**接受率.** 图 1 (右) 显示了在去噪步骤中每个位置的接受率。早期步骤接受率较高 (>0.8),晚期步骤下降,表明草稿在噪声较少时更准确。 ## 5 相关工作 **离散扩散模型.** 离散扩散模型 (Austin 等,2021a;Lou 等,2024;Gat 等,2024;Sahoo 等,2024) 将连续空间扩散扩展到离散结构。D3PM (Austin 等,2021a) 为分类数据建立了一个通用扩散框架,本文在此基础上构建。后续工作在离散扩散语言建模方面取得了进展 (Nie 等,2025;Ye 等,2025;Bie 等,2025)。**因子化错误.** 因子化错误的概念已在离散扩散模型的背景下被认识到。ReDi (Yoo 等,2025) 通过整流流和配对训练数据来缓解它,但没有完全消除。其他工作 (Liu 等,2024;Lavenant 和 Zanella,2025) 探索了改进的采样过程,但以速度为代价。我们的工作通过精确的前缀条件化分解直接消除了该错误。**推测解码.** 推测解码 (Leviathan 等,2023;Chen 等,2023) 已广泛应用于加速自回归模型。最近的一些工作将其扩展到扩散模型 (Campbell 等,2025;Cheng 等,2025),但主要针对连续扩散或具有自回归混合的模型。我们的工作将推测解码应用于离散扩散,同时保持其并行生成特性。 ## 6 结论 我们提出 FeF-DLLM,一种通过精确前缀条件化分解消除因子化错误、并通过推测解码实现加速的离散扩散语言模型。实验表明,FeF-DLLM 在准确率和推理速度上显著优于基线。未来工作包括扩展到更大的语言模型、探索更高效的草稿模型设计,以及将我们的方法应用于其他离散生成任务。 ## 附录 A 符号表 | 符号 | 含义 | |---|---| | X0X_{0} | 干净序列 | | XtX_{t} | 时间步 tt 的损坏序列 | | X0iX_{0}^{i} | 干净序列中的第 ii 个 token | | X0<iX_{0}^{<i} | 前 i-1i-1 个 token 的前缀 | | Xt≥iX_{t}^{\ge i} | 从位置 ii 开始的损坏序列后缀 | | QtQ_{t} | 时间步 tt 的转移矩阵 | | πθ\pi_{\theta} | 目标模型 | | ρϕ\rho_{\phi} | 草稿模型 | | kk | 草稿窗口大小 | | α\alpha | 平均接受率 | ## 附录 B 算法 **算法 1** FeF-DLLM 生成过程 1: 输入:目标模型 πθ\pi_{\theta},草稿模型 ρϕ\rho_{\phi},步数 TT,窗口大小 kk 2: 从先验 p(XT)p(X_{T}) 采样 XTX_{T} 3: for t=Tt=T to 1 do 4: X0(已接受)←∅{Accepted tokens}X_{0}^{\text{(已接受)}} \leftarrow \emptyset \quad \text{\{Accepted tokens\}} 5: while 序列未完成 do 6: 设 m=∣X0(已接受)∣m = |X_{0}^{\text{(已接受)}}| 7: 草稿模型提议:对于 i=1,…,ki=1,\dots,k,采样 X~0m+i∼ρϕ(⋅∣Xt,{X0j:j<m+i})\tilde{X}_{0}^{m+i} \sim \rho_{\phi}(\cdot \mid X_{t}, \{X_{0}^{j}: j < m+i\}) 8: 目标模型验证:对于 i=1,…,ki=1,\dots,k,计算接受概率 aia_{i} 基于拒绝采样 9: 接受候选直到第一个被拒绝的 token 10: 将接受的 token 追加到 X0(已接受)X_{0}^{\text{(已接受)}} 11: 如果所有 kk 个 token 都被接受,则继续;否则跳出 while 循环 12: end while 13: 使用接受的前缀和公式 1 进行去噪 14: end for 15: 输出:生成的序列 ## 附录 C 定理证明 ### C.1 引理 1 的证明 证明:我们写出完整的后验并应用链式法则。令 p(X0∣Xt)=p(X0∣Xt)p(X_{0} \mid X_{t}) = \frac{p(X_{0}) p(X_{t} \mid X_{0})}{p(X_{t})}。对于位置 ii,条件后验 p(X0i∣Xt,X0<i)∝p(X0i∣X0<i) p(Xt∣X0i,X0<i)p(X_{0}^{i} \mid X_{t}, X_{0}^{<i}) \propto p(X_{0}^{i} \mid X_{0}^{<i}) \, p(X_{t} \mid X_{0}^{i}, X_{0}^{<i})。由于损坏是独立的,p(Xt∣X0i,X0<i)=∏j=1dp(Xtj∣X0j)=p(Xti∣X0i)∏j≠ip(Xtj∣X0j)p(X_{t} \mid X_{0}^{i}, X_{0}^{<i}) = \prod_{j=1}^{d} p(X_{t}^{j} \mid X_{0}^{j}) = p(X_{t}^{i} \mid X_{0}^{i}) \prod_{j \neq i} p(X_{t}^{j} \mid X_{0}^{j})。第二项 ∏j≠ip(Xtj∣X0j)\prod_{j \neq i} p(X_{t}^{j} \mid X_{0}^{j}) 不依赖于 X0iX_{0}^{i} (因为给定所有 X0jX_{0}^{j},它被固定),所以它可以被吸收到归一化常数中。此外,由于损坏独立于位置,p(Xti∣X0i)p(X_{t}^{i} \mid X_{0}^{i}) 仅依赖于 X0iX_{0}^{i} 和遮盖指示符。因此,p(X0i∣Xt,X0<i)∝p(X0i∣X0<i) p(Xti∣X0i)p(X_{0}^{i} \mid X_{t}, X_{0}^{<i}) \propto p(X_{0}^{i} \mid X_{0}^{<i}) \, p(X_{t}^{i} \mid X_{0}^{i})。最后,由于 Xt≥iX_{t}^{\ge i} 等条件不影响比例关系(它们不包含关于 X0iX_{0}^{i} 的信息,除了通过 p(Xti∣X0i)p(X_{t}^{i} \mid X_{0}^{i})),我们得到所需的等价形式。∎ ### C.2 定理 2 的证明 证明:令 CkC_{k} 为草稿在一轮中被接受的 token 数。设每个 token 的接受概率独立为 α\alpha (近似)。则 Pr(Ck>ℓ)=αℓ\Pr(C_{k} > \ell) = \alpha^{\ell},对于 ℓ=0,…,k−1\ell = 0,\dots,k-1。然后,E[Ck]=∑ℓ=0k−1αℓ=1−αk1−α\mathbb{E}[C_{k}] = \sum_{\ell=0}^{k-1} \alpha^{\ell} = \frac{1-\alpha^{k}}{1-\alpha} (对于 α<1\alpha < 1)。一轮的成本是草稿模型的一次前向传播 (cρc_{\rho}) 加上目标模型的一次前向传播 (cπc_{\pi})。基线顺序前缀条件化需要每个 token 进行一次目标模型前向传播。因此,对于 E[Ck]\mathbb{E}[C_{k}] 个 token,基线成本为 E[Ck]cπ\mathbb{E}[C_{k}] c_{\pi}。FeF-DLLM 的成本为 cρ+cπc_{\rho} + c_{\pi}。加速比为 S=E[Ck]cπcρ+cπS = \frac{\mathbb{E}[C_{k}] c_{\pi}}{c_{\rho} + c_{\pi}}。如果 cρ≈cπc_{\rho} \approx c_{\pi},则 S≈E[Ck]/2S \approx \mathbb{E}[C_{k}]/2。∎
相似文章
Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码
Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
Prefilling-dLLM:扩散语言模型中长上下文推理的预测性预填充
本文提出Prefilling-dLLM,一种无需训练的框架,它将前缀分割成块并缓存KV表示,在扩散语言模型的长上下文推理中实现了最先进的质量和高达28倍的加速。
PSD: 通过并行推测解码推动扩散大语言模型的帕累托前沿
本文介绍了一种无需训练的框架——并行推测解码(PSD),它通过同时提升空间和时间效率来加速扩散大语言模型的推理,每次前向传递最多可处理5.5×的token数,且质量与贪婪解码相当。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。