DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速
摘要
提出DC-Leap,一种无训练框架,通过引入动态连续验证和草稿引导解码来加速扩散大语言模型,在保持生成质量的同时实现高达105倍的加速。
arXiv:2607.20467v1 Announce Type: new
摘要:虽然并行解码是扩散大语言模型(dLLMs)效率的核心,但当前策略常常受到过于保守的置信度阈值的阻碍。这些阈值由联合概率依赖误差(JPDE)导致,造成冗余的去噪迭代和次优的推理速度。为了克服这一问题,我们提出了DC-Leap,一种无训练框架,能够在中等置信度区间内实现dLLMs的可靠加速。DC-Leap引入了一种动态连续验证策略,将严格排序的因果约束整合到并行解码过程中。通过逐步验证令牌依赖关系,该机制有效消除了JPDE,从而实现性能相当下的可靠加速。此外,DC-Leap还集成了草稿引导解码机制,其中草稿通过跨越多个令牌向前跳跃来扩展上下文,提供前瞻上下文并在推理过程中保留双向注意力机制的结构优势。在标准基准上的大量实验表明,DC-Leap实现了显著的加速,在MBPP长序列生成上达到53.19倍,结合KV-Cache时达到105.02倍,同时生成质量相当。代码可在https://github.com/ffh-wyls/DC-Leap获取。
查看缓存全文
缓存时间: 2026/07/24 05:00
# 训练免加速的dLLMs:基于草稿引导的连续跳跃解码
来源:https://arxiv.org/html/2607.20467
Tianyi Wu¹, Xiaoxi Sun¹, Yulin Li¹, Huiling Zhen³, Libo Qin¹, Baotian Hu¹,², Zhuotao Tian¹,², Min Zhang¹,²
###### 摘要
尽管并行解码是扩散大语言模型(dLLMs)效率的核心,但现有策略往往受限于过度保守的置信度阈值。这些阈值是由于联合概率依赖误差(JPDE)而必需的,导致冗余的去噪迭代和次优的推理速度。为了克服这一问题,我们提出了DC-Leap,一个无需训练的框架,能够在中等置信度区域内实现dLLMs的可靠加速。DC-Leap引入了一种动态连续验证策略,将严格顺序的因果约束整合到并行解码过程中。通过逐步验证令牌依赖关系,该机制有效消除了JPDE,实现了具有可比性能的可靠加速。此外,DC-Leap还纳入了草稿引导的解码机制,其中草稿通过向前跳跃多个令牌来扩展上下文,提供前瞻性上下文,并在推理过程中保留双向注意力的结构优势。在标准基准上的大量实验表明,DC-Leap实现了显著的加速,在MBPP的长序列生成中最高可达53.19倍,在与KV-Cache结合时最高可达105.02倍,且生成质量相当。代码可在https://github.com/ffh-wyls/DC-Leap获取。
机器学习,ICML
¹哈尔滨工业大学(深圳)
²深圳环区研究院
³华为诺亚方舟实验室
\icml@noticeprintedtrue
†通讯作者:Zhuotao Tian <\>.
第43届国际机器学习大会论文集,韩国首尔。PMLR 306, 2026。
2026年作者版权所有。
图1: DC-Leap概述与性能。上图:所提出的无需训练框架示意图,包括通过因果约束消除JPDE的动态连续验证,以及通过远端上下文加速收敛的草稿机制。下图:在MBPP上对长序列生成的评估。DC-Leap实现了高达53.19倍的显著加速,同时保持了近乎无损的性能。
## 1 引言
扩散大语言模型(dLLMs),如LLaDA(Nie 等人,2025;Zhu 等人,2025)和Dream(Ye 等人,2025),已成为一种引人注目的生成范式,通过提供非自回归能力并实现与类似规模模型相当的生成质量,挑战了自回归(AR)模型的主导地位。与AR架构中严格的顺序依赖不同,dLLMs天然支持并行解码,为克服顺序令牌生成相关的延迟瓶颈提供了一条可行路径。然而,dLLMs常常不得不诉诸冗余的迭代细化,导致推理吞吐量落后于高度优化的AR模型,从而限制了dLLMs在延迟敏感应用中的实用性。
(a) LLaDA-1.5在不同置信区间内正确与错误预测的频率。在宽松置信区间(0.65-0.9)内的令牌占正确预测的很大一部分,却被保守阈值丢弃。
(b) 中间令牌的置信度差距(Ptop1 − Ptop2)。存在右侧上下文(蓝线)显著扩大了相对于基线(灰线)的差距。这一趋势表明,未来信息使预测分布更加尖锐,从而减少了中间令牌生成过程中的歧义。
图2: DC-Leap的动机。(a) 现有并行解码方法中的严格置信阈值导致可能正确的令牌被浪费。(b) 利用右侧上下文减少了置信度差距,促进了更快的收敛。
#### 动机。
为了减轻dLLMs的计算负担,最近的研究集中于并行解码策略,如Fast-dLLM(Wu 等人,2026)和LocalLeap(Kong 等人,2025)。这些方法通过基于置信度阈值每步接受多个令牌来加速解码。通常,这些方法使用严格的、高置信度阈值(通常高于0.9)。然而,如图2(a)所示,很大一部分正确令牌(在0.65–0.9置信区间内占61%)因低于预定义置信度阈值而被丢弃。这种过早过滤可能通过限制模型在较低置信度区域利用快速令牌收敛的能力,形成效率瓶颈,从而限制潜在的加速收益。事实上,这种严格的阈值设定主要源于管理并行接受策略引入的误差的需要:它们的有效性依赖于令牌预测在当前上下文下条件独立的假设。然而,Ben-Hamu等人(2026)的最新发现指出,并行解码固有地引入了联合概率依赖误差(JPDE),这是由于同时预测多个令牌而忽略了它们之间的相互依赖,导致输出不连贯。因此,一个关键的研究问题出现了:我们能否通过其他方法(而非严格的置信度阈值)来减轻依赖引起的误差(即JPDE),从而安全地降低阈值并获得更大的加速?
#### 顺序解码的局限性。
缓解JPDE的一种自然方法是采用顺序解码,即逐个提交令牌,使每个预测明确依赖于先前接受的令牌。原则上,这种策略通过避免在同一迭代中同时预测令牌来解决依赖误差;相反,通过链式法则分解跨令牌的联合预测。然而,顺序解码在dLLMs的背景下面临两个基本限制。首先,它遭受令人望而却步的低效率:顺序提交减少了并行性,导致前向传递次数(从而延迟)随序列长度线性增长,严重削弱了加速效果。其次,顺序解码为双向dLLMs产生了不利的推理模式:顺序预测固有的结构化(通常从左到右)条件模式偏离了dLLMs双向去噪训练中遇到的分布,如图2(b)中“无右侧上下文”(完全掩码)设置下大多数令牌的置信度差距较小所证明的那样。这种不匹配限制了在推理时利用双向上下文以及双向注意力机制带来的性能提升。
#### 我们的解决方案。
为了在保持并行解码效率和dLLMs双向上下文优势的同时减轻JPDE,我们引入了DC-Leap,一种通过草稿引导的连续跳跃解码实现的无需训练加速策略。DC-Leap从顺序提交中汲取灵感,但规避了其两大局限性。它包含两个主要机制:1) 动态连续验证(DCV)和2) 草稿引导解码。具体来说,DCV引入了动态解码窗口,强制对令牌进行局部的、顺序的从左到右验证。在每个窗口内,令牌被连续接受,直到某个预测低于置信度阈值,从而用局部的、窗口级别的分解替换并行解码固有的全局条件独立假设,实现多令牌接受同时保持效率。另一方面,为了解决顺序提交引起的分布不匹配和上下文限制,DC-Leap保留未提交的草稿,即预测在解码窗口之外的高置信度令牌。这些草稿通过向前跳跃多个令牌来扩展上下文,提供前瞻性上下文,并在推理过程中保留双向注意力的结构优势。在三个dLLMs上进行的广泛实验,涵盖五个基准(包括数学推理、指令遵循和代码生成),证明了DC-Leap的有效性和泛化能力。我们的主要贡献可总结如下:
- •我们确定了dLLMs加速中的一个关键权衡:控制联合概率依赖误差(JPDE)需要并行解码中的严格阈值,而顺序解码虽减少JPDE却牺牲了效率和双向推理。
- •我们提出了DC-Leap,一个有效的解码框架,集成了动态连续验证与前瞻草稿机制,安全地降低了并行解码的接受阈值,同时在推理过程中利用了双向注意力。
- •在LLaDA-1.5、LLaDA-8B-Instruct和Dream-v0-7B-Instruct模型上,跨五个基准的大量实验验证了DC-Leap的有效性,展示了在不牺牲基线生成质量的前提下显著的推理加速。
## 2 背景与动机
在本节中,我们首先在第2.1节介绍dLLMs的基础知识,然后在第2.2节介绍我们的实证发现,这些发现激励了我们所提出框架的设计。
### 2.1 基础知识
#### dLLMs中的并行解码。
考虑一个生成任务,旨在生成长度为M的目标序列x_gen,条件为长度为N的提示x_prompt。完整序列记为x ∈ V^L,其中L = N + M,词汇表为V。令[MASK] ∈ V表示掩码令牌。与自回归方法不同,dLLMs(Nie 等人,2025)在离散时间步t ∈ {T, T-1, ..., 0}上采用非自回归迭代去噪过程,通常从步骤T开始,将完全掩码的响应附加到提示后:
x^T = (x_prompt, [MASK], ..., [MASK]⏟M次)。 (1)
在每个去噪迭代t中,模型p_θ同时估计所有掩码位置上词汇表的分类分布。具体来说,对于任何位置i(其中x_i^t = [MASK]),模型计算令牌概率:
P(x_i = v | x^t) = [Softmax(p_θ(x^t)_i)]_v, ∀v ∈ V。 (2)
dLLMs的并行解码方法(Wu 等人,2026;Ben-Hamu 等人,2026)通常采用基于置信度的阈值策略来从x^t过渡到x^{t-1}。具体来说,对于每个掩码令牌位置i,独立做出二进制接受决策M_i,如下:
M_i = I(max_{v∈V} P(x_i = v | x^t) > τ), (3)
其中τ ∈ [0,1]表示预定义的置信度阈值。满足M_i=1的令牌在单个迭代中同时被提交。
#### 并行解码中的联合概率依赖误差。
并行解码策略通过同时预测由集合U索引的多个掩码令牌来加速推理。这些方法用边际乘积Q(x_U | C) = ∏_{i∈U} p_θ(x_i | C)近似真实联合分布P(x_U | C),其中C是已解码的上下文。这种条件独立假设引入了联合概率依赖误差E。正如Ben-Hamu等人(2026)推导的,该误差可以通过KL散度量化,其严格上界由目标令牌的边际熵给出:
E = D_KL(P ∥ Q) ≤ ∑_{i∈U} H(x_i | C) - max_{j∈U} H(x_j | C)。 (4)
对于非连续解码,由分散的已验证令牌组成的稀疏上下文C_0产生高累积熵和宽松的误差界。因此,这些方法强制要求使用保守的置信度阈值τ(式(3))来过滤不可靠的预测,严重削弱了它们的加速潜力。
### 2.2 关键观察
正如引言中讨论的,并行解码从根本上受到JPDE的约束,因此依赖严格的置信度阈值来最小化误差。然而,这种保守导致在早期迭代中过多地拒绝正确的令牌(图2(a))。这引出了一个核心挑战:我们如何安全地降低阈值以恢复这些令牌而不损害准确性?该问题可等价地转化为缓解第2.1节讨论的JPDE,而不依赖严格的阈值。我们从顺序解码中汲取灵感,后者理论上不受JPDE影响,因为它严格遵循概率链式法则:
P(x_{1:T} | C) = ∏_{t=1}^T P(x_t | x_{<t}, C)。 (5)
W = ∑_{i=0}^{L-1} ∏_{j=0}^i I(c_j > τ_commit), (6)
它计算令牌置信度连续超过提交阈值的最长连续前缀的长度。连续单调窗口的这种顺序推进确保了令牌按正确顺序得到验证。通过防止乱序提交,该机制允许DCV安全地采用更宽松的置信度阈值,从而最大化每个并行解码迭代中接受的令牌数量。
### 3.3 草稿引导解码
虽然DCV通过窗口级别的顺序性有效缓解了JPDE,但它固有地限制了模型在推理过程中对右侧上下文的访问。这种上下文截断削弱了双向dLLMs利用未来令牌信息的能力,可能导致次优的推理性能。为了克服这个问题,我们引入了草稿引导解码,一种维护未提交草稿占位符以提供前瞻性上下文的方法,从而在推理过程中保留双向注意力的结构优势。具体来说,我们通过预测当前解码窗口之外选定位置的令牌来生成草稿,相似文章
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力
本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。
扩散语言模型的动态分块
本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。
LaCache: 扩散大语言模型的精确缓存与精度自适应推理
LaCache 提出了一种针对扩散式LLM的无训练加速框架,利用无损缓存和精度自适应推理消除去噪步骤中的冗余计算,在保持任务精度的同时实现了高达40.2倍的端到端加速。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。