Ripple-Pivot Search:扩散大语言模型的主动并行解码

arXiv cs.CL 论文

摘要

提出了Ripple-Pivot Search,一种无需训练的扩散大语言模型解码方法,主动确定中熵枢轴位置以减少不确定性并加速并行解码,实现4-10倍加速。

arXiv:2608.11742v1 公告类型:新 摘要:扩散大语言模型(dLLMs)已成为自回归语言模型的竞争性替代方案,通过并行解码提供了大幅加速推理的潜力。现有的并行解码调度器通常仅在位置满足逐位置标准后才提交,忽略了早期提交可能对后续解码带来的益处。我们在dLLM解码中发现了一种涟漪效应:主动确定一个中熵枢轴位置可以显著降低其余掩码位置的不确定性。这种不确定性降低使得后续步骤能够并行解掩更多令牌,从而加速整个解码过程。为了利用这一涟漪效应,我们提出了Ripple-Pivot Search(RPS),一种新颖的无需训练的解码方法,用于寻找中熵位置作为有前景的候选枢轴(即解码位置),并通过前瞻评估确定其令牌分配(即解码内容),以获得最大的下游收益。在3个dLLM和4个推理与代码生成基准上,RPS在保持生成质量的同时,相比标准解码器实现了4-10倍的墙钟加速,并在大多数设置中相比之前的前瞻基线将准确率提升了高达5.49%,同时提供了更高的吞吐量。与KV缓存集成后,RPS相比标准解码器进一步实现了高达18倍的墙钟加速。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:28

# 扩散大语言模型的主动并行解码
来源:https://arxiv.org/html/2608.11742
Yushi Ye Xu Chen Haoyun Jiang Jinsong Lan Haihong Tang 附属机构:上海交通大学协同媒体创新中心 附属机构:上海交通大学协同媒体创新中心 Bo Han Ivor Tsang Yanfeng Wang Bo Zheng Jiangchao Yao 附属机构:上海交通大学协同媒体创新中心 附属机构:阿里巴巴集团 TMLR 组,香港浸会大学计算机科学系 附属机构:A\*STAR CFAR 与南洋理工大学 附属机构:上海交通大学人工智能学院
\{stephen\-ye, Sunarker\}@sjtu\.edu\.cn

###### 摘要

扩散大语言模型(dLLMs)已成为自回归语言模型的极具竞争力的替代方案,其通过并行解码有望实现大幅更快的推理速度。现有的并行解码调度器通常仅在位置满足逐位置准则后才提交,忽略了早期提交可能对后续解码带来的收益。我们发现了 dLLM 解码中的一种涟漪效应:主动提交一个*中熵*枢纽位置能够在其余掩码位置上诱发显著的不确定性降低。这种不确定性降低使得后续步骤能够并行地解开更多令牌,从而加速整个解码过程。为了利用这一涟漪效应,我们提出了 Ripple-Pivot Search(RPS),一种新颖的无需训练的解码方法,用于寻找中熵位置作为有前景的候选枢纽(*在哪里解码*),并通过前瞻评估确定能带来最大下游收益的令牌分配(*解码什么*)。在 3 个 dLLM 和 4 个推理与代码生成基准上,RPS 相比标准解码器实现了 4–10 倍的端到端加速,同时保持了生成质量,并在大多数设置中相比先前的前瞻基线将准确率提升了最高 5.49%,且吞吐量更高。当与 KV 缓存集成时,RPS 相比标准解码器进一步实现了高达 18 倍的端到端加速。

## 1 引言

扩散大语言模型(dLLMs)(15 (https://arxiv.org/html/2608.11742#bib.bib6);24 (https://arxiv.org/html/2608.11742#bib.bib5);21 (https://arxiv.org/html/2608.11742#bib.bib2);7 (https://arxiv.org/html/2608.11742#bib.bib12);4 (https://arxiv.org/html/2608.11742#bib.bib13))已成为自回归语言模型 (5 (https://arxiv.org/html/2608.11742#bib.bib9);20 (https://arxiv.org/html/2608.11742#bib.bib10);23 (https://arxiv.org/html/2608.11742#bib.bib11)) 的一种可行替代方案,其通过并行解码多个令牌提供了更快推理的可能性。在每个去噪步骤中,模型同时在所有掩码位置产生预测,解码调度器选择要解开的掩码位置并为这些位置分配令牌。然而在实践中,每个步骤提交更多位置会增加错误累积的风险(12 (https://arxiv.org/html/2608.11742#bib.bib14)),这使得解码速度与生成质量之间的权衡成为 dLLM 推理中的核心挑战。

为了应对这种速度-质量权衡,越来越多的并行解码研究工作(10 (https://arxiv.org/html/2608.11742#bib.bib8);18 (https://arxiv.org/html/2608.11742#bib.bib4);14 (https://arxiv.org/html/2608.11742#bib.bib15);22 (https://arxiv.org/html/2608.11742#bib.bib1);25 (https://arxiv.org/html/2608.11742#bib.bib25))专注于设计能够在可靠性约束下每步提交多个位置的调度器,从而分摊每次前向传播的成本。因此,调度器负责两个决策:*在哪里*解开掩码,以及*分配什么*令牌。大多数调度器将这两者耦合起来,一旦满足逐位置准则,就将其贪心预测提交到该位置,例如足够的置信度(17 (https://arxiv.org/html/2608.11742#bib.bib3);15 (https://arxiv.org/html/2608.11742#bib.bib6))、低预测熵(21 (https://arxiv.org/html/2608.11742#bib.bib2))、跨步骤稳定性(11 (https://arxiv.org/html/2608.11742#bib.bib23))或受限的累积熵(3 (https://arxiv.org/html/2608.11742#bib.bib22))。最近基于前瞻的方法(19 (https://arxiv.org/html/2608.11742#bib.bib7);9 (https://arxiv.org/html/2608.11742#bib.bib20))进一步测试了提交一个额外位置是否有利于后续解码。然而,这些方法主要利用前瞻来决定是否提交以及在哪里提交。一旦选择了一个位置,其令牌通常固定为模型当前的 top-1 预测。因此,搜索探索了不同的提交位置,但未探索替代的令牌分配,可能会忽略有效的非贪心解码轨迹。

方法家族 | 在哪里解码 | 解码什么
置信度基(17 (https://arxiv.org/html/2608.11742#bib.bib3);15 (https://arxiv.org/html/2608.11742#bib.bib6)) | 置信度合格的位置 | Top-1(贪心)
熵基(21 (https://arxiv.org/html/2608.11742#bib.bib2);3 (https://arxiv.org/html/2608.11742#bib.bib22)) | 熵合格的位置 | Top-1(贪心)
稳定性基(11 (https://arxiv.org/html/2608.11742#bib.bib23);16 (https://arxiv.org/html/2608.11742#bib.bib24)) | 跨步骤稳定的位置 | Top-1(贪心)
前瞻基(19 (https://arxiv.org/html/2608.11742#bib.bib7);9 (https://arxiv.org/html/2608.11742#bib.bib20)) | 前瞻选择的位置 | Top-1(贪心)
RPS(我们的) | 中熵枢纽 | 前瞻选择的(非贪心)
参见图注 图1:左侧:并行解码调度器的比较。右侧:从一个部分解码的块开始,我们将每个剩余掩码位置提交到其 oracle 令牌,并测量在其它掩码位置产生的熵降低 ΔHi\\Delta H\_\{i\}(y 轴)与所解析位置的提交前熵 HbeforeH\_\{\\mathrm\{before\}\}(x 轴)之间的关系。颜色表示 oracle 令牌在模型分布下的排名,阴影带标记中熵区域。

早期提交的收益关键取决于选择哪个未解析位置。为了描述这一现象,我们在图1(右侧)中对候选提交进行了 oracle 分析。该分析揭示了一种我们称之为*涟漪效应*的显著模式:主动提交一个处于*中熵*区域的枢纽位置能够诱发最强的下游不确定性降低。直观地说,这些位置尚未完全确定,但已经与当前的部分解码状态充分关联;因此,解析它们可以比那些已经确定或仍受约束较弱的位置更强地影响其它掩码位置。此外,在中熵情况下,85% 的正确令牌并非模型的 top-1 预测,这表明现有基于前瞻的调度器存在不匹配。如图1(左侧)所示,这些方法使用前瞻来决定*在哪里*提交,同时将*什么*固定为当前的 top-1 预测。因此,它们搜索提交位置但不搜索令牌分配,可能会错过有益的非贪心轨迹。

受这些发现的启发,我们提出了 Ripple-Pivot Search(RPS),一种无需训练的并行解码方法,利用中熵区域中有益的早期提交。RPS 首先应用两阶段枢纽过滤器,排除那些过度确定或未被当前预测分布充分支持的位置,从而聚焦于中熵区域。在此枢纽的基础上,RPS 构建一个自适应的合理令牌分配集合,通过一次前瞻前向传播评估其下游收益,并选择最有前景的令牌进行早期提交。这使得 RPS 能够选择预期能最大程度放大涟漪效应的分配。

此外,为了防止过早提交累积错误,RPS 仅在提交一个令牌比保持该枢纽未掩码状态更好时才提交该令牌。总而言之,我们的贡献如下:

- •我们识别了 dLLM 解码中的*涟漪效应*:主动提交处于中熵区域的位置会诱发最强的下游不确定性降低,从而在后续步骤中实现更多的并行提交。关键的是,该区域中的正确令牌通常不是当前的 top-1 预测,这促使我们在贪心解码之外探索令牌分配。
- •我们提出了 Ripple-Pivot Search(RPS),一种新颖的无需训练的解码方法,用于寻找具有较高下游不确定性降低潜力的中熵枢纽,并通过在自适应候选集上进行基于前瞻的评估来确定其令牌分配,在最佳候选优于保持枢纽未掩码时进行提交。
- •我们在三个 dLLM 上、四个推理和代码生成基准上进行了广泛实验。RPS 相比标准的每步一个令牌基线实现了 4–10 倍的推理加速,同时保持了生成质量,并在大多数设置中相比先前的前瞻基线将准确率提升了最高 5.49%,且吞吐量更高。当与 KV 缓存集成时,RPS 相比标准解码器进一步实现了高达 18 倍的端到端加速。

## 2 相关工作

#### 基于准则的并行解码。

加速 dLLM 推理最直接的方法是基于逐位置预测统计量在每个解码步骤提交多个位置。Fast-dLLM(17 (https://arxiv.org/html/2608.11742#bib.bib3)) 解开所有预测置信度超过固定阈值的位置,并引入块级 KV 缓存以降低每次前向传播的成本。KLASS(11 (https://arxiv.org/html/2608.11742#bib.bib23)) 用 KL 散度准则增强了置信度,该准则追踪连续步骤间的预测稳定性,只解开既置信又时间一致的位置。EB-Sampler(3 (https://arxiv.org/html/2608.11742#bib.bib22)) 通过限制新提交位置的累积熵来控制每步解开的令牌数量。Learn2PD(2 (https://arxiv.org/html/2608.11742#bib.bib21)) 进一步用轻量级学习过滤器取代固定启发式规则,预测每个当前令牌预测是否与最终输出匹配,从而为并行解开提供自适应准则。

#### 基于前瞻的并行解码。

基于前瞻的 dLLM 解码通过提出令牌分配并评估其下游效果来加速推理。WINO(10 (https://arxiv.org/html/2608.11742#bib.bib8)) 草拟所有通过宽松置信度阈值的位置,并在丰富上下文下评估提交的令牌,将验证置信度低于更严格阈值的位置重新掩码。LoPA(19 (https://arxiv.org/html/2608.11742#bib.bib7)) 从标准解码更新后仍保持掩码的最高置信度位置中形成前瞻分支,并选择未来置信度最大的分支。从信息论的角度来看,ETE(9 (https://arxiv.org/html/2608.11742#bib.bib20)) 认为优先处理高置信度位置会限制每轮解码所揭示的信息。因此,它探索接近指定置信度水平的高信息位置,并选择能解锁最多下游高置信度令牌的位置。然而,这些方法主要使用前瞻来决定*在哪里*提交,同时保持贪心令牌分配。相比之下,RPS 聚焦于中熵区域,并使用前瞻联合决定*在哪里*提交以及*分配什么*令牌。

## 3 预备知识

#### 符号。

考虑一个词汇表为 V\\mathcal\{V\} 的掩码离散扩散语言模型,其中包含一个特殊的掩码令牌 [MASK]\[\\texttt\{MASK\}\]。给定提示 yy,长度为 LL 的响应表示为 x∈VLx\\in\\mathcal\{V\}^\{L\},其中每个位置要么已解码,要么被掩码。设 M⊆\{1,...,L\}\\mathcal\{M\}\\subseteq\\\{1,\\ldots,L\\\} 表示当前被掩码的响应位置集合。给定输入 [y∥x]\[y\\\|x\],模型在单次前向传播中返回谓词分布 \{pi=pθ\(⋅∣y,x\)\}i∈M\\\{p\_\{i\}=p\_\{\\theta\}\(\\cdot\\mid y,x\)\\\}\_\{i\\in\\mathcal\{M\}\}。将 H⁡\(pi\)H\(p\_\{i\}\) 记为位置 ii 处的预测熵,将 Pimax≜maxv∈V⁡pi\(v\)P\_\{i\}^\{\\max\}\\triangleq\\max\_\{v\\in\\mathcal\{V\}\}p\_\{i\}\(v\) 记为其*置信度*,即其 top-11 概率。

#### 解码。

标准实践(15 (https://arxiv.org/html/2608.11742#bib.bib6);4 (https://arxiv.org/html/2608.11742#bib.bib13);17 (https://arxiv.org/html/2608.11742#bib.bib3))采用半自回归调度:将长度为 LL 的响应划分为大小为 BB 的连续块,并从左到右解码,在下一个块之前完全解开每个块。在每个块内,每个解码步骤都具有相同的形式。给定当前的 \{pi\}i∈M\\\{p\_\{i\}\\\}\_\{i\\in\\mathcal\{M\}\},选择一个提交集 S⊆M\\mathcal\{S\}\\subseteq\\mathcal\{M\},并将 S\\mathcal\{S\} 中每个位置分配其贪心(top-1)预测,

xi←arg⁡maxv∈Vpi\(v\),对于每个 i∈S\.x\_\{i\}\\;\\leftarrow\\;\\arg\\max\_\{v\\in\\mathcal\{V\}\}p\_\{i\}\(v\)\\quad\\text\{对于每个 \}i\\in\\mathcal\{S\}\.\(1\) 不同的调度器通过如何指定 S\\mathcal\{S\} 来加以区分。三种最常见的规则是:

S=\{top\-ki∈M⁡\(\{P1max,...,PLmax\}\),最高置信度解码(15 (https://arxiv.org/html/2608.11742#bib.bib6));top\-ki∈M⁡\(\{−H⁡\(p1\),...,−H⁡\(pL\)\}\),最低熵解码(21 (https://arxiv.org/html/2608.11742#bib.bib2));\{i∈M:Pimax≥τ\},置信度感知解码(17 (https://arxiv.org/html/2608.11742#bib.bib3))\.\\displaystyle\\mathcal\{S\}=\\begin\{cases\}\\operatorname\{top\\text\{\-\}k\}\_\{i\\in\\mathcal\{M\}\}\\big\(\\left\\\{P\_\{1\}^\{\\max\},\\dots,P\_\{L\}^\{\\max\}\\right\\\}\\big\),&\\text\{最高置信度解码~\\cite\[citep\]\{\(\\@@bibref\{AuthorsPhrase1Year\}\{DBLP:journals/corr/abs\-2502\-09992\}\{\\@@citephrase\{, \}\}\{\}\)\}\};\\\\ \\\\ \\operatorname\{top\\text\{\-\}k\}\_\{i\\in\\mathcal\{M\}\}\\big\(\\left\\\{\\\!\-H\(p\_\{1\}\),\\dots,\\\!\-H\(p\_\{L\}\)\\right\\\}\\big\),&\\text\{最低熵解码~\\cite\[citep\]\{\(\\@@bibref\{AuthorsPhrase1Year\}\{DBLP:journals/corr/abs\-2508\-15487\}\{\\@@citephrase\{, \}\}\{\}\)\}\};\\\\ \\\\ \\big\\\{i\\in\\mathcal\{M\}:P\_\{i\}^\{\\max\}\\geq\\tau\\big\\\},&\\text\{置信度感知解码~\\cite\[citep\]\{\(\\@@bibref\{AuthorsPhrase1Year\}\{DBLP:journals/corr/abs\-2505\-22618\}\{\\@@citephrase\{, \}\}\{\}\)\}\}\.\\\\ \\end\{cases\}(2) 所有三种规则在如何构建 S\\mathcal\{S\} 上有所不同,但共享相同的令牌分配机制:每个提交的位置都获得其贪心预测(公式1)。未被选入 S\\mathcal\{S\} 的位置保持掩码状态,直到随着解码的进行满足该准则。

## 4 方法

### 4\.1 Ripple-Pivot Search

我们的 RPS 在标准解码过程之上引入了逐步枢纽搜索,如图2所示,包括*枢纽选择*(在哪里提交)和*前瞻评分*(提交什么)。

#### 枢纽选择。

枢纽选择必须平衡收益与成本:枢纽应位于中熵区域,在该区域早期解析最为有益,同时保持前瞻令牌搜索的紧凑性。尽管这些位置存在不确定性,但正确令牌通常仍排在排名最高的候选中。受此观察启发,RPS 将每个位置的支持截断为 top-kmaxk\_\{\\max\} 个令牌,丢弃与决策无关的大部分词汇项,其形式化如下:

相似文章

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。

面向扩散语言模型的自适应多步前瞻解码

arXiv cs.CL

提出 AdaLook,一种适用于掩码扩散语言模型的自适应多步前瞻解码框架,该框架根据候选分数方差动态确定展开深度和分支扩展,与现有的单步前瞻解码方法相比,实现了更好的准确率-解码步骤权衡。