推测性流水线解码:通过流水线并行实现更高准确度和零泡沫推测

arXiv cs.CL 论文

摘要

本文提出推测性流水线解码(SPD),一种在单个LLM内部利用流水线并行实现并行令牌推测的框架,避免了传统推测解码中多令牌预测的延迟泡沫和准确度下降问题。

arXiv:2605.30852v1 公告类型:新 摘要:推测性解码(SD)通过采用草稿-验证范式加速低并发LLM推理。然而,主流方法通常依赖于多令牌预测,这引入了不断增加的预测难度和串行草稿延迟。为了解决这些问题,我们提出了推测性流水线解码(SPD),这是一个突破性框架,释放了流水线并行的真正潜力。通过将目标LLM划分为n个流水线阶段,SPD允许LLM并行处理n个令牌以加速解码。为了在单序列解码中持续填充流水线,推测模块跨不同流水线深度聚合中间特征以预测下一个令牌,与目标模型的流水线步骤严格并行执行,从而实现有界的难度、更高的接受率和零延迟泡沫。我们的实验表明,与主流基线相比,SPD实现了显著更高的理论加速,为LLM解码加速提供了一种高度可扩展的解决方案。我们的代码可在https://github.com/yuyijiong/speculative_pipeline_decoding获取。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:29

# 推测式流水线解码:通过流水线并行实现高精度零气泡推测
来源:https://arxiv.org/html/2605.30852
Huazheng Wang  
Oregon State University  
\{yuyiji, huazheng\.wang\}@oregonstate\.edu  
Shuai Yuan  
DeepSolution  
research@deepsolution\.chat  
Ruilong Ren  
DeepSolution  
research@deepsolution\.chat  
Ji Pei  
DeepSolution  
research@deepsolution\.chat  

###### 摘要

推测解码通过先草稿后验证的范式加速低并发大语言模型推理。然而,主流方法通常依赖于多令牌预测,这引入了不断增加的预测难度和串行草稿延迟。为了解决这些问题,我们提出推测式流水线解码(SPD),这是一个开创性的框架,释放了流水线并行的真正潜力。通过将目标大语言模型划分为 \(n\) 个流水线阶段,SPD 允许大语言模型并行处理 \(n\) 个令牌以加速解码。为了在单序列解码中持续填充流水线,一个推测模块聚合不同流水线深度上的中间特征来预测下一个令牌,并与目标模型的流水线步骤严格并行执行,从而实现了有界难度、更高的接受率和零延迟气泡。我们的实验表明,与主流基线相比,SPD 实现了显著更高的理论加速比,为大语言模型解码加速提供了高度可扩展的解决方案。我们的代码可在 GitHub 上获取(https://github.com/yuyijiong/speculative_pipeline_decoding)。

---

## 1 引言

大语言模型的推理过程受其自回归性质所限,性能瓶颈主要来自内存带宽而非计算能力。推测解码(Leviathan 等人,2023)作为一种突出的解决方案出现,用于缓解这种内存受限的延迟。传统的推测解码使用一个更小、独立的草稿模型来预测一系列未来令牌,随后由目标大语言模型一起验证。最近的进展,如 EAGLE(Li 等人,2024),通过向目标模型附加一个轻量级的特征外推头,直接利用大语言模型的内部隐藏状态来提高草稿接受率,从而绕过了对外部草稿模型的需求。尽管有这些改进,现有的推测解码方法从根本上仍然固守于多令牌预测范式。这种范式天生具有两个关键的结构性限制,阻碍了进一步的加速。首先,复合预测难度,也称为长程衰减,严重限制了有效的草稿长度。当草稿预测未来 \(k\) 个令牌时,草稿模块必须自回归地依赖其自身浅层且未经验证的隐藏状态来生成后续令牌。随着预测步骤远离最后一个已验证的令牌,草稿模块不完整的特征空间与目标模型真实分布之间的分歧迅速增大。这种分布外累积导致后续令牌的接受率急剧下降,使得更深的推测效率低下且浪费。许多研究试图缓解这一问题,但无法从根本上解决。例如,EAGLE-3(Li 等人,2026)提出在训练时进行测试,以更好地训练草稿模块预测更远的令牌,但它在训练中模拟的草稿长度仅限于 8,无法覆盖更激进的草稿长度。其次,多令牌范式引入了延迟开销和相互等待。草稿令牌的串行生成导致目标模型空闲,消耗了加速效果。最近的方法试图缓解这一问题,但引入了严重的权衡。例如,P-EAGLE(Hui 等人,2026)并行生成草稿令牌,这减少了但并未消除延迟,同时使训练复杂度呈二次方增长并面临精度下降的风险。另一种方法,推测式推测解码(Kumar 等人,2026)通过让草稿模块预测验证结果来实现草稿和验证的并行化。虽然在避免空闲时间的同时,这种几何分支扩展引入了更复杂的任务,显著增加了草稿模块的计算 FLOPs 和显存占用。

认识到串行多令牌草稿的局限性,PPSD(Li 等人,2025)提出将大语言模型划分为流水线阶段,并使用第一阶段的一个早期退出头来猜测下一个令牌。虽然 PPSD 正确识别了流水线并行的好处,但其推测方法简单地局限于第一阶段的浅层隐藏状态,缺乏关键的深层信息,导致接受率低于 EAGLE-3(Li 等人,2026)等主流方法,并且无法扩展到更多阶段。此外,其推测仍然与目标模型串行执行,仍然引入了顺序延迟和相互等待。

为了克服这些限制,我们提出了推测式流水线解码(SPD),这是一种开创性的推测解码范式。与 PPSD(Li 等人,2025)类似,我们将目标大语言模型的执行重组为 \(n\) 阶段流水线,使其能够并发处理处于不同深度的 \(n\) 个令牌。然而,我们不是进行多令牌猜测或简单的早期退出,而是引入了一个结构简单的鲁棒推测模块,在每一步预测单个下一个令牌以填充流水线。SPD 有两个关键创新,直接解决了上述瓶颈:首先,SPD 采用多深度特征聚合来严格限制预测难度(见图 1)。我们的模块从当前目标大语言模型流水线中的所有令牌收集部分处理的特征,以及来自已验证令牌的完全处理特征。由于推测基于来自目标大语言模型多个层的更丰富、对齐的上下文,草稿精度显著提高。特征信息的不完全度在数学上被常数流水线长度 \(n\) 所限制,避免了传统草稿中随着草稿长度增加而无限增大的复合误差。从另一个角度看,流水线并行范式天生绕过了草稿长度的选择——这在传统推测解码中是一个敏感的超参数。其次,SPD 实现了零相互等待开销。我们策略性地将推测模块的执行窗口前移,仅基于流水线的输入状态而非输出状态执行它,使其完全与目标模型的流水线步骤并行运行。尽管基于较早状态预测下一个令牌略微增加了固有的预测难度,但我们鲁棒的多深度特征弥补了这一缺陷。因此,我们可以使用更深的推测网络,其延迟被目标模型的流水线步骤完美掩盖,完全消除了延迟气泡,最大化 GPU 利用率。

我们使用 Qwen3.5-4B 和 Qwen3.5-9B(Qwen Team,2026)在三个代表性基准测试——MT-Bench(Zheng 等人,2023)、GSM8K(Cobbe 等人,2021)和 HumanEval(Chen 等人,2021)上进行了广泛评估。我们引入了等价接受长度(\(\mathcal{L}^\prime_\mathrm{acc}\))这一指标来严格评估理论加速比,该指标严格考虑了流水线初始化开销和拒绝时的刷新惩罚。实验结果表明,SPD 在大多数设置下持续提供可比的等价接受长度,并在理论加速比上超越了主流基线 EAGLE-3(Li 等人,2026),显示出其成为下一代主流推测解码算法的前景。

> 参见图 1:当阶段数为 3 时的推测式流水线解码架构。目标大语言模型被划分为 3 个阶段。在本轮开始时,令牌(例如 \(x_5\) 到 \(x_7\))位于流水线中的不同深度,而其他令牌(例如 \(x_1\) 到 \(x_4\))是完全处理过的令牌。对于每个令牌,通过全连接层投影已通过阶段的隐藏状态,形成聚合特征,作为流水线推测模块的输入。推测模块与目标大语言模型的流水线前向步骤同时推测下一个令牌(\(x_8\))。然后,\(x_8\) 的令牌嵌入被添加到流水线中以进行下一轮,而目标大语言模型根据刚刚弹出流水线的令牌 \(x_5\) 的真实输出 logits 来验证流水线中最旧的令牌(\(x_6\))。

## 2 相关工作

**推测解码。** 标准推测解码框架(Leviathan 等人,2023)通过使用一个更小、高效的草稿模型顺序生成多个候选令牌来加速大语言模型推理。这些候选令牌随后由更大的目标模型在单次前向传播中并行评估。虽然这种草稿-验证范式保证了与标准自回归解码相同的输出分布,但其性能紧密受限于草稿模型与目标模型之间的对齐程度,以及草稿模型本身的顺序延迟开销。

**自推测解码与特征外推。** 为了消除维护一个完全独立草稿模型的开销,最近的研究将草稿机制直接集成到目标模型中。EAGLE(Li 等人,2024)引入了特征级外推,为目标模型附加一个轻量级预测头,利用内部隐藏状态生成候选令牌。EAGLE-3(Li 等人,2026)通过融合多层隐藏特征(低层、中层和高层)来为草稿头提供更丰富的上下文,并利用训练时测试来解决分布不匹配问题,从而推进了这一架构。然而,这些方法仍然存在复合预测难度和串行延迟的问题,因为它们依赖于基本的多令牌预测范式。

**并行与异步推测。** 一些最近的框架试图解决传统草稿中固有的顺序延迟。P-EAGLE(Hui 等人,2026)修改了草稿阶段以并行生成多个令牌来减轻延迟,但这是以训练复杂度二次方增长和潜在输出质量下降为代价的。为了最大化 GPU 利用率,推测式推测解码(Kumar 等人,2026)提出了一种异步方法,其中草稿模型连续预测预期的验证结果。然而,这造成了可能性的几何扩展,显著增加了草稿模块的任务复杂度、计算量和内存需求。SpecPipe(Yin 等人,2025)结合了并行并行和推测解码以最大化 GPU 利用率,但它仅在使用草稿树时是系统级的优化,并未减少单序列延迟。与此同时,流水线并行自推测解码(PPSD)(Li 等人,2025)将模型层分布到流水线上,并使用早期退出的目标大语言模型特征来推测下一个令牌。不幸的是,PPSD 简单地将输入限制为第一个流水线阶段的浅层特征,导致草稿精度低,并且随着阶段数量的增加扩展性差。此外,PPSD 仍在目标大语言模型的流水线步骤之后执行推测模块,因此,将其低精度的线性头升级为多层 transformer 以提高草稿精度,将重新引入延迟和相互等待。

## 3 方法

### 3.1 流水线执行框架

为了克服传统多令牌预测的顺序延迟,推测式流水线解码(SPD)使用标准的 \(n\) 阶段流水线并行架构(分布式大语言模型推理中的常见做法)来执行目标大语言模型。SPD 不是顺序处理单个令牌通过所有 \(L\) 层,而是并发处理处于不同深度的 \(n\) 个令牌。在任何给定的周期 \(t\),单次流水线前向步骤将所有活动令牌推进到其后续阶段。为了保持最大吞吐量并防止计算气泡,在单序列解码中,每步必须正好有一个完全处理的令牌退出最终阶段,并且一个新令牌必须进入第一阶段。这种连续流在单序列解码中造成了一个时间依赖悖论:要在不停止的情况下向流水线提供下一个令牌 \(x_{t+1}\),我们必须在其仍在早期流水线阶段且尚未产生最终输出 logits 时就对 \(x_t\) 的后续令牌进行推测。因此,我们引入了一个流水线推测模块,如图 1 所示。

### 3.2 推测模块概述

推测模块的核心由一个单层或多层 Transformer 解码器(具有因果注意力)后接一个标准语言模型头组成。在每个解码步骤中,该模块接收一个与当前生成序列中所有令牌对应的特征序列作为输入。这些特征通过 Transformer 层处理后,最后令牌的输出状态再通过 LM 头来猜测下一个令牌 \(x_{t+1}\)。从根本上说,所有令牌的输入特征直接来自目标模型的内部隐藏状态。然而,当前生成序列同时包含两种不同完成状态的令牌:那些已由目标大语言模型完成处理的,以及那些部分处理的(当前位于不同流水线阶段内)。因此,我们必须设计一个定制的特征收集机制,能够根据令牌当前的流水线深度提取鲁棒的表示。

### 3.3 多深度特征聚合

为了处理处于不同完成状态的令牌并最大化草稿精度,我们提出了一种多深度特征聚合策略,如图 1 左侧部分所示。与简单地使用第一阶段浅层输出的 PPSD(Li 等人,2025)不同,我们的推测模块尽可能深地收集目标大语言模型中间隐藏状态的特征,具体取决于每个令牌当前可用的隐藏状态层数。设 \(H_t^l\) 表示令牌 \(x_t\) 在层 \(l \in \{0, 1, \dots, L\}\) 处的隐藏状态,其中 \(l=0\) 表示初始令牌嵌入层。假设在当前步骤,令牌 \(x_t\) 已完成 \(k\) 个流水线阶段(\(k \in \{0, 1, \dots, n\}\)),这意味着它已被处理至其最深可用层 \(l_{\max} = k \cdot (L/n)\)。

相似文章

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。