面向扩散语言模型的自适应多步前瞻解码
摘要
提出 AdaLook,一种适用于掩码扩散语言模型的自适应多步前瞻解码框架,该框架根据候选分数方差动态确定展开深度和分支扩展,与现有的单步前瞻解码方法相比,实现了更好的准确率-解码步骤权衡。
查看缓存全文
缓存时间: 2026/07/20 09:34
# 面向扩散语言模型的自适应多步前瞻解码
来源:https://arxiv.org/html/2607.15655
Yingqian Cui¹, Wei Deng², Lantao Mei, Hang Li¹, Charu C. Aggarwal³, Hui Liu¹, Yue Xing¹
¹密歇根州立大学 ²摩根士丹利 ³IBM T.J. Watson研究中心
###### 摘要
掩蔽扩散语言模型(DLMs)通过迭代优化掩蔽标记实现并行文本生成,为自回归解码提供了一种有前景的替代方案。近期基于前瞻的解码方法通过在提交标记更新之前探索未来解码状态,改善了准确率与效率之间的权衡。然而,现有方法主要依赖浅层的单步前瞻,优化即时信息增益,但对于更长视野的解码轨迹可能不是最优的。同时,我们发现直接扩展为更深层的前瞻也效果不佳,因为固定深度的展开会引入额外计算,且无法适应异构的中间解码状态。因此,本文提出AdaLook,一种用于DLM解码的自适应前瞻框架。AdaLook基于候选分数方差动态决定是否继续展开,并在中间展开状态需要额外探索时支持分支扩展。这种设计避免了不必要的深层展开,同时允许解码器从信息丰富的中间状态重新触发前瞻。在多个基准和模型上的实验表明,AdaLook在准确率-解码步数权衡上优于现有的单步前瞻解码方法。
# 面向扩散语言模型的自适应多步前瞻解码
Yingqian Cui¹, Wei Deng², Lantao Mei, Hang Li¹, Charu C. Aggarwal³, Hui Liu¹, Yue Xing¹
¹密歇根州立大学 ²摩根士丹利 ³IBM T.J. Watson研究中心
## 1 引言
掩蔽扩散语言模型(DLMs)近年来已成为传统自回归(AR)模型在文本生成领域的一种替代方案。与AR模型逐个标记顺序生成不同,DLMs通过迭代优化一个掩蔽标记序列来运作,支持跨多个位置并行解码(Sahoo等人, 2024 (https://arxiv.org/html/2607.15655#bib.bib1);Nie等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib2);Ye等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib25))。这一特性相比于AR解码具有根本性优势:通过放宽严格的从左到右依赖关系,DLMs可以潜在地提高生成效率,并支持更灵活的推理策略。
参见图注
图1:准确率 vs 解码步数(在MATH500上使用LLaDA-8B-Instruct评估)
虽然扩散框架原则上支持并行标记更新,但其基于去噪的训练目标并未指定具体的解码顺序或标记选择策略,这为推理时的解码留下了广阔的设计空间,而这些设计会对生成质量和效率产生重大影响。为了更好利用DLMs的并行特性,越来越多的研究专注于设计高效解码策略。现有方法已从固定步长并行解码(Nie等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib2))发展为更自适应的置信度感知解码框架(Yu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib4);Wu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib17);Wei等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib16))。
尽管大多数方法依赖基于当前置信度估计的贪心标记选择,Fu等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib15))提出了一种基于前瞻的策略性探索机制,通过候选标记更新的下游解码收益来评估它们。具体来说,该方法在模型对剩余掩蔽位置表现出低置信度时,对未来解码状态执行前瞻搜索。它旨在识别信息性标记,这些标记的提交能引发后续的一系列高置信度预测,从而使得每步可以解码更多标记,并减少所需的总解码步数。
由于该方法是从即时信息增益的角度设计的,它主要评估一个试探性标记提交能否使下一个解码状态中的更多掩蔽位置变得置信。这自然导致了单步前瞻设计。然而,从更长视野来看,这种局部探索可能是次优的:最大化即时置信度增益的标记可能不会带来最佳未来轨迹,导致搜索陷入局部有利但全局次优的提交。
为了弥补这一差距,我们专注于开发一个多步前瞻框架,该框架基于更长的解码视野评估候选标记更新,而不是仅凭即时单步证据。一种直接的方法是沿着未来解码轨迹执行更深的展开。然而,这种扩展引入了额外的技术挑战。根据我们在图1 (https://arxiv.org/html/2607.15655#S1.F1)中展示的初始实验,简单增加前瞻深度并不能改善生成质量与解码步数之间的权衡。
这一局限主要源于两个方面:(L1) 更深的前瞻引入了额外的计算开销,而最优展开深度在同一数据集的不同样本以及同一样本的不同解码阶段之间可能差异很大。因此,统一固定的展开深度可能会引入额外计算而不会产生相应的性能提升,最终损害整体质量-效率权衡。(L2) 朴素的多步展开为每个假设遵循固定的前向轨迹,缺乏评估中间展开状态是否需要进一步分支的机制。这阻止了解码器在中间展开状态仍然不确定时动态分支到替代解码路径。
为了解决这些局限,我们提出了**AdaLook**(自适应前瞻解码),一个多步前瞻框架,它基于解码状态动态决定展开深度,同时在前瞻过程中支持分支扩展。针对(L1),在每个额外展开步骤之前,AdaLook基于从前沿置信度计算出的候选分数方差来决定是否需要进一步展开。只有当方差超过预定义阈值时,解码器才继续扩展未来解码轨迹。针对(L2),在每个展开步骤之后,对每个分支重新评估,以确定是否需要额外扩展。解码器然后联合考虑所有候选分支的扩展状态:不再需要进一步扩展的分支被优先处理。如果所有分支都需要进一步扩展,则选择得分最高的分支,并将其解码状态传回作为下一轮前瞻探索的起点。这种自适应过程避免了不必要的深层展开,同时允许在中间阶段灵活重新触发前瞻,使得解码器能够发现并提交更具信息性的解码轨迹。
如图1 (https://arxiv.org/html/2607.15655#S1.F1)所示,AdaLook实现了比现有1步前瞻解码方法更好的准确率-解码步数权衡。大量实验进一步证明,这一优势在不同数据集和模型骨干上具有一致的泛化性。
## 2 相关工作
**扩散语言模型。** 扩散模型在图像和音频生成等连续域取得了显著成功(Ho等人, 2020 (https://arxiv.org/html/2607.15655#bib.bib13);Song等人, 2020 (https://arxiv.org/html/2607.15655#bib.bib14);Kong等人, 2020 (https://arxiv.org/html/2607.15655#bib.bib7)),这推动了将扩散范式扩展到离散文本领域的努力。离散扩散的早期工作,特别是D3PM(Austin等人, 2021 (https://arxiv.org/html/2607.15655#bib.bib12)),为在分类变量上定义噪声过程(包括吸收状态掩蔽破坏)建立了通用框架。后续工作利用这种基于掩蔽的公式化来开发掩蔽扩散语言模型(MDLMs),通过迭代去掩蔽生成文本(Sahoo等人, 2024 (https://arxiv.org/html/2607.15655#bib.bib1);Shi等人, 2024 (https://arxiv.org/html/2607.15655#bib.bib11);Ou等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib8))。在这些基础上,近期大规模MDLMs已达到与自回归对应模型竞争的性能:LLaDA(Nie等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib2))从头开始训练了一个具有双向注意力的8B模型,Dream(Ye等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib25))从预训练自回归模型初始化开发了基于扩散的LLM,而LLaDA 2.0(Bie等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib10))进一步扩展到100B参数,采用混合专家架构。
**MDLMs的解码策略。** 为了充分利用MDLMs的并行特性,越来越多的研究专注于设计高效解码策略。最初的尝试关注固定步长并行解码(Nie等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib2);Ye等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib25)),而后续工作引入了更自适应的置信度感知解码策略,包括固定阈值和动态阈值解码(Yu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib4);Wu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib17))。其他研究通过多阶段解码策略(Wei等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib16))、置信度校准(Huang等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib24))、熵约束去掩蔽(Ben-Hamu等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib23))以及KV缓存技术(Wu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib17);Liu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib22))进一步提高了解码效率。最近,基于前瞻的解码方法通过在提交更新之前探索未来解码轨迹,引入了推理时的搜索(Lee等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib3);Fu等人, 2025 (https://arxiv.org/html/2607.15655#bib.bib15))。然而,正如第1节 (https://arxiv.org/html/2607.15655#S1)所讨论的,现有方法主要依赖浅层单步前瞻,这限制了它们在解码过程中进行长视野规划的能力。值得注意的是,我们的工作主要建立在Fu等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib15))面向效率的前瞻框架之上,该框架旨在实现更好的准确率-解码步数权衡。相比之下,Lee等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib3))主要使用前瞻来增强生成性能,对解码效率关注较少。
## 3 预备知识
我们的多步前瞻框架建立在Fu等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib15))引入的“先探索后利用”(Explore-then-Exploit, ETE)解码策略之上。在本节中,我们介绍ETE的两个组成部分:**快速块扩散采样**和**基于置信度的前瞻机制**。
### 3.1 快速块扩散采样
块扩散解码以逐块方式渐进生成序列,其中长度为 \(n\) 的序列被划分为 \(L\) 个解码块,每个块大小为 \(n_b\)。在每个块内,解码器执行迭代优化,然后才进入下一个块(Nie等人, 2026 (https://arxiv.org/html/2607.15655#bib.bib2))。
快速块扩散采样通过为每个块分配固定的 \(N\) 解码步预算,并在预算耗尽后即进入下一个块(而不是等待当前块完全收敛)来提高解码效率。由于当当前块开始解码时,前面的块可能仍包含掩蔽标记,因此解码器在每一步会同时提交所有已解锁块中的高置信度标记,与仅在单个块内解码相比,从而增加了每步解码步数中可去掩蔽的标记数量。
### 3.2 基于置信度的前瞻机制
基于置信度的前瞻机制的核心思想是:当模型对剩余掩蔽位置的置信度较低时,选择性地执行前瞻探索。它使用1步前向展开来识别哪些标记更新最有可能解锁后续的高置信度预测。这里的置信度是指模型在每个掩蔽位置对其最可能标记的预测概率。探索过程可分为三个部分:探索触发、候选构建和假设选择。
1. **探索触发。** 当当前解码前沿 \(\mathcal{F}\) 上的平均置信度低于阈值 \(\gamma\),且剩余掩蔽位置数量超过最小值 \(N_e\) 时,解码器激活前瞻探索。前沿 \(\mathcal{F}\) 定义为当前块中点之前的掩蔽位置集合。
2. **候选构建。** 根据 Fu等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib15)) 的候选选择策略,一旦触发探索,该方法会从掩蔽位置中识别出一组信息性候选位置:
\[\mathcal{H}=\mathrm{Topk}_{i\in\mathcal{M}_t}\left(-\left\|c_t^i(\mathbf{x}_t)-c^{\mathrm{info}}\right\|+\beta\cdot(i-(b_t-1)n_b)\right),\]
其中 \(\mathbf{x}_t\) 表示解码步骤 \(t\) 的部分解码序列,\(\mathcal{M}_t\) 为掩蔽位置集合。\(c_t^i(\mathbf{x}_t)\) 表示位置 \(i\) 处的置信度,\(b_t\) 是步骤 \(t\) 时当前解码块的索引,\(n_b\) 是块大小,\(\beta\) 是平衡两项的超参数。第一项选择置信度接近目标探索水平 \(c^{\mathrm{info}}\) 的位置,这捕获了不确定但可能具有信息性的标记。根据 Fu等人 (2025 (https://arxiv.org/html/2607.15655#bib.bib15)) 的实证发现,我们设置 \(c^{\mathrm{info}}=0.2\),因为处于该置信度水平的标记被证明对触发更多下游高置信度预测更具信息性。第二项使用 \(i-(b_t-1)n_b\),即标记 \(i\) 在当前块内的相对位置,当 \(\beta>0\) 时赋予靠后位置略高的分数,从而鼓励解码前沿向前移动。
3. **假设选择。** 对于每个候选位置 \(j \in \mathcal{H}\),解码器提交位置 \(j\) 并执行一步前向传递以获得结果状态 \(\mathbf{x}_{t+1;j}\)。每个假设的得分计算如下:
\[
s(j)=\alpha\cdot\log c_t^j(\mathbf{x}_t)+\log\sum_{i\in\hat{S}_{t+1}(j)} c_{t+1}^i(\mathbf{x}_{t+1;j})\mathbf{1}\!\left(c_t^i(\mathbf{x}_{t+1;j})\geq C\right).
\]
其中 \(\hat{S}_{t+1}(j)\) 表示展开后的预测标记位置,\(C\) 是置信度阈值,\(\alpha\) 是平衡两项的正则化参数。直观上,该评分函数同时考虑了被提交标记本身的置信度相似文章
Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models
This paper introduces LATCH, a training-free candidate-aware early-exit framework for diffusion language models that separates when to stop from where to accelerate, achieving 9.3-17.8x speedups on short-answer tasks and 2-3.3x on long-reasoning tasks with minimal accuracy loss on LLaDA and Dream.
掩码扩散解码作为$x$-预测流
本文重新将掩码扩散语言模型解码解释为连续干净状态预测,引入了一个基于流的框架,其中令牌根据置信度连续异步更新,在仅使用25%的解码预算下,达到了LLaDA性能的97%。
基于注意力折扣的自适应采样器用于掩码扩散语言模型
本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
This paper proposes speculative correction, a training-free draft-then-refine decoding strategy for diffusion language models, showing quality-latency improvements using LLaDA2.1 models.
LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力
本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。