整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL 论文

摘要

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

arXiv:2607.27735v1 公告类型:新 摘要:推测解码缓解了大语言模型推理中的内存带宽瓶颈,但其加速效果同时受到草稿开销、令牌接受率和推测长度的制约。我们提出了一种统一的效率分析,表明当边际接受概率低于相对草稿成本时,延长推测范围反而会降低而不是提升加速比。在该分析的指导下,我们引入了SparseSpec-L,一种用于长上下文推理的无需训练的自推测解码框架。SparseSpec-L直接利用目标模型,通过动态稀疏化且可召回的KV缓存生成轻量级草稿。它回收全上下文验证过程中产生的每头注意力统计信息,作为无需额外前向传播的重要性信号,从而在不永久丢弃密集KV缓存的情况下召回关键历史令牌。一个基于熵的在线控制器还根据预期的逐步效率选择推测长度。在多个长上下文任务和模型规模上的实验表明,端到端加速效果一致,相比自回归解码最高可实现加速,同时保持目标模型的输出分布。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:02

# 全局的稀疏一瞥:免训练自推测解码

来源:https://arxiv.org/html/2607.27735

Yuesong Liu1\equalcontrib, Yuan Zeng1\equalcontrib, Min Lyu1\corresponding, Ruilin Liu1, Yu Guo1, Yinlong Xu1

###### 摘要

推测解码缓解了大语言模型推理中的内存带宽瓶颈,但其加速效果同时受到草稿开销、令牌接受率和推测长度的制约。我们提出了一种统一的效率分析,表明当边际接受概率降至相对草稿开销以下时,延长推测视界反而会降低加速比,而非提升。在该分析的指导下,我们提出了 SparseSpec-L,一种面向长上下文推理的免训练自推测解码框架。SparseSpec-L 利用动态稀疏化且可召回的 KV 缓存,直接从目标模型生成轻量级草稿。它复用全上下文验证阶段产生的逐头注意力统计信息,作为无需额外前向传播的重要性信号,从而在不永久丢弃稠密 KV 缓存的前提下召回关键历史令牌。在线基于熵的控制器进一步根据期望的逐步效率选择推测长度。在多种长上下文任务和模型规模上的实验表明,与自回归解码相比,SparseSpec-L 可获得一致的端到端加速,最高达 2.79×,同时保持目标模型的输出分布。

## 引言

参见图 1 的说明:现有推测解码范式对比(α 为令牌接受率,γ 表示草稿开销,k 表示推测长度,C_t 表示重训练成本)。辅助模型存在结构差距,抑制了接受率;Medusa 在架构层面固定推测长度 k;EAGLE-3 在较大 k 时出现接受率衰减;静态压缩方法永久丢弃上下文,导致信息丢失。各基线局限性的经验证据见:†表1(https://arxiv.org/html/2607.27735#Sx3.T1)、§附录和‡图2(https://arxiv.org/html/2607.27735#Sx2.F2)。

大语言模型(LLM)在生成和推理任务中展现出强大的能力,但其自回归解码过程造成了严重的推理延迟瓶颈。具体而言,预测后续每个令牌都需要将前面上下文的整个键值(KV)缓存加载到处理器中,这使得解码过程高度受限于内存带宽(Vaswani 等人 2017(https://arxiv.org/html/2607.27735#bib.bib16);Kwon 等人 2023(https://arxiv.org/html/2607.27735#bib.bib18))。在长上下文场景中,这一挑战更加严峻:线性增长的内存占用和二次复杂度的注意力计算(Dao 2023(https://arxiv.org/html/2607.27735#bib.bib40))严重损害了实时响应能力。

为缓解这种低效,推测解码已成为突破该瓶颈的一种有前景的范式。通过将生成过程解耦为计算成本低廉的草稿阶段和并行验证阶段,它迭代地提出并同时验证多个候选令牌。这有效地释放了近倍数级的加速潜力,同时在数学上保证精确的目标分布(Xia 等人 2024(https://arxiv.org/html/2607.27735#bib.bib41))。

尽管理论上优美,但充分实现推测解码的加速潜力仍是一项实际挑战。如图 1(https://arxiv.org/html/2607.27735#Sx1.F1)所分类,代表性方法暴露出四个常见局限:(1) **辅助模型**(Chen 等人 2023(https://arxiv.org/html/2607.27735#bib.bib19);Leviathan 等人 2023(https://arxiv.org/html/2607.27735#bib.bib20);Miao 等人 2024(https://arxiv.org/html/2607.27735#bib.bib21))依赖独立的小型起草器,但起草器与目标模型之间的固有结构差距从根本上抑制了接受率。(2) **预测头**类方法(如 Medusa(Cai 等人 2024a(https://arxiv.org/html/2607.27735#bib.bib32))通过将起草头直接附加到目标模型上来缓解这一差距,但其推测长度 k 在架构层面被刚性固定,对可实现的加速比形成了硬性的数学上限。(3) **轻量层**类方法(如 Eagle-3(Li 等人 2025(https://arxiv.org/html/2607.27735#bib.bib30))支持灵活的推测长度,但其自回归近似在尾部令牌上会遭遇接受率的急剧下降,在较大 k 时性能严重衰减,并且对数据集表现出极强的依赖性。(4) **静态压缩**方法(Sadhukhan 等人 2024(https://arxiv.org/html/2607.27735#bib.bib35);Chen 等人 2025(https://arxiv.org/html/2607.27735#bib.bib34))提供了一种免训练替代方案,通过激进地丢弃历史上下文来最小化草稿开销。然而,这种不可逆的剪枝永久性地破坏了上下文保真度,导致持续的信息丢失,并在长上下文场景中造成低接受率。这些代表性范式暴露了草稿开销、推测长度和接受率之间反复出现的权衡。尽管不同方法占据不同的工作点,但所有被评估的方法均未同时保持低草稿成本、稳健的长上下文接受率以及自适应的推测视界。

为解决这些局限,我们提出了 SparseSpec-L,一种面向长上下文推理的免训练自推测解码框架。SparseSpec-L 将目标模型本身同时用作起草器和验证器,避免了辅助草稿模型的结构性失配。在草稿阶段,目标模型访问动态稀疏化的 KV 缓存;而验证阶段保留完整 KV 缓存,因此保持了目标分布。SparseSpec-L 并不永久驱逐历史上下文,而是复用上一次全上下文验证阶段产生的逐头注意力统计信息,为下一轮草稿构建可召回的稀疏索引。这不需要额外的模型前向传播,尽管当前的非融合注意力实现仍会带来内核级开销。在线基于熵的控制器还根据实时草稿置信度以及测量到的草稿和验证成本来调整推测长度。

稀疏上下文的目标模型执行也已被 TriForce(Sun 等人 2024(https://arxiv.org/html/2607.27735#bib.bib53))、之前的 SparseSpec(Zhao 等人 2025(https://arxiv.org/html/2607.27735#bib.bib54))和 Vegas(Yue 等人 2026(https://arxiv.org/html/2607.27735#bib.bib55))探索过。SparseSpec-L 与它们共享“稀疏到全量”的原则,但采用单模型、单验证阶段的流水线,从验证注意力统计信息中刷新逐头索引,并根据期望的逐步效率选择推测视界。因此,我们将其定位为一种面向长输入工作负载的效率导向设计,而非首个稀疏 KV 推测解码框架。

我们的贡献有三点。(1) **效率分析**。我们将推测解码的加速比形式化为草稿成本、前缀接受率和推测长度的联合函数,并刻画了当延长草稿视界不再摊销其边际成本时出现的效率反转。(2) **可召回的稀疏上下文自推测**。我们开发了一种免训练、单模型的稀疏到全量解码流水线,利用前一次全上下文验证阶段的注意力统计信息刷新逐头稀疏 KV 索引,而不会永久丢弃历史 KV 状态。(3) **成本感知的自适应推测**。我们从在线熵统计信息中估计令牌级接受率,并选择能够最大化期望逐步效率的推测长度。在长上下文检索、推理和综合任务上的实验表明,SparseSpec-L 可获得一致的端到端加速,最高达 2.79×。

## 重新思考推测解码

为了从根本上理解现有加速算法的局限性并启发 SparseSpec-L 的设计,我们首先将推测解码抽象为一个广义框架。通过量化该过程中的效率瓶颈,我们可以勾勒出最优解决方案所需的确切蓝图。

### 草稿-验证范式

推测解码通过将顺序生成过程解耦为两阶段流水线来加速自回归生成(Brown 等人 2020(https://arxiv.org/html/2607.27735#bib.bib44)):(1) **草稿阶段**。一种轻量近似机制生成 k 个候选令牌,\(\mathcal{X}_{\text{draft}}=\{\hat{x}_{n+1},\ldots,\hat{x}_{n+k}\}\),旨在以最小计算模拟目标模型的分布。(2) **验证阶段**。完整目标模型在单次并行前向传播中评估 \(\mathcal{X}_{\text{draft}}\),识别出满足验证标准的最长前缀:\(\mathcal{X}_{\text{prefix}}=\{\hat{x}_{n+1},\ldots,\hat{x}_{n+m}\}\)。系统随后提交这 m 个令牌,并额外生成一个纠正令牌 \(x_{n+m+1}\)。因此,每一步只需一次目标模型前向传播即可产生 m+1 个令牌。该框架在数学上保证了与标准解码的等价性,同时每一步都可能提供多令牌加速(Chen 等人 2023(https://arxiv.org/html/2607.27735#bib.bib19);Leviathan 等人 2023(https://arxiv.org/html/2607.27735#bib.bib20))。

### 统一加速比分析

为量化推测解码的性能,我们将加速比 S 定义为相对于标准解码的吞吐量。令 k 表示推测长度,即草稿组件每一步生成的候选令牌数量。令 \(\alpha\in[0,1]\) 为期望接受率,表示每次迭代中被接受的草稿令牌的期望比例(\(\alpha=\mathbf{E}[m/k]\))。平均而言,系统在单步中产生 \(\alpha k+1\) 个令牌。

对 k 个令牌进行一次并行验证的时间成本近似等于一个标准步骤的时间成本,我们将两者都记为 \(C_v\)。令 \(C_d\) 为草稿组件每令牌的成本。加速比 S 可表示为:

\[
S=\frac{(\alpha k+1)C_v}{kC_d+C_v}=\frac{\alpha k+1}{k(C_d/C_v)+1} \tag{1}
\]

为了理解推测长度 k 的根本影响,我们首先定义相对草稿开销为 \(\gamma=C_d/C_v\)。在接受率 \(\alpha\) 被视为常数的理想化场景中,k 对加速比 S 的影响可通过其偏导数来量化:

\[
\frac{\partial S}{\partial k}=\frac{\alpha-\gamma}{(k\gamma+1)^2} \tag{2}
\]

公式 2(https://arxiv.org/html/2607.27735#Sx2.E2)表明,延长推测长度的收益根本上取决于 \(\alpha\) 相对于 \(\gamma\) 的大小。如果 \(\alpha>\gamma\),则加速比 S 是 k 的单调递增函数,意味着更长的推测长度总是带来更高的效率。相反,如果 \(\alpha<\gamma\),则导数 \(\frac{\partial S}{\partial k}\) 保持为负,表明草稿过程相对于其准确性而言成本过高,任何推测都将使性能相对于标准解码下降。

参见图 2 的说明:Eagle-3 与 MagicDec(SnapKV)在不同推测步数下的性能分析。对于每种方法,左 y 轴表示令牌接受(命中)率,右 y 轴表示相对于自回归解码的加速比。结果在 LongBench v2 和 XSum 上基于 Llama3.1-8B-Instruct 报告。

虽然常数 \(\alpha\) 的情形提供了一个理论阈值,但在实践中,期望接受率 \(\alpha\) 会随 k 的增大而持续衰减。随着推测长度的增加,自回归生成的复合不确定性导致尾部令牌的接受率衰减。最终,这会触发**效率反转**,即一个临界点:额外草拟一个令牌的边际成本超过其对加速比的期望贡献(\(\alpha_{\text{tail}}<\gamma\))。因此,在不同上下文中固定 k 本质上是次优的。

这一理论反转以及现有范式的局限性在图 2(https://arxiv.org/html/2607.27735#Sx2.F2)中得到了实证验证。首先,基于训练的模型和免训练静态压缩方法都表现出随 k 增大而出现的严重加速比“塌陷”,这直接由 \(\alpha\) 的急剧衰减引起。例如,在 LongBench v2 上,MagicDec 的加速比在 k=2 时提前达到峰值 1.74×。然而,将推测长度推到 k=16 会引发 \(\alpha\) 灾难性地下降至 6.3%,最终使整体加速比退化到低于基线的 0.36×。类似地,在相同长度扩展下,Eagle-3 在 XSum 数据集上的加速比从 2.24× 回退到 1.83×。其次,图 2(https://arxiv.org/html/2607.27735#Sx2.F2)暴露了基于训练方法的严重数据依赖。Eagle-3 在其原始评估中常用的 XSum 数据集上可获得约 67.2% 的稳健接受率,但转移到长上下文 LongBench 场景后,其性能骤降至仅 8.4%。

因此,最大化加速本质上是一个多维优化问题。如图 1(https://arxiv.org/html/2607.27735#Sx1.F1)所总结,一个理想的框架必须同时保证可接受的草稿成本 γ、稳健的接受率 α 以及最优的推测长度 k。然而,现有范式无法实现这一点。如实验所证明,仅仅为了追求更高加速比而强制使用更长的推测长度会导致 α 急剧下降,最终引发效率反转,使实际加速不升反降。这一加速瓶颈催生了 SparseSpec-L。我们的方法通过两种机制推高实际加速比上限:第一,可召回的自推测本质上保证了高且可泛化的 α;第二,熵引导的自适应策略动态调整 k,使生成过程始终处于峰值效率区间,从而有效缓解效率反转。

## 方法

参见图 3 的说明:SparseSpec-L 的稀疏到全量自推测解码流水线概览。左:可召回稀疏 KV 缓存索引在每个注意力头上构建,依据上一次验证阶段的注意力分数保留 sink 令牌、重要历史令牌和近期令牌。右:草稿令牌通过稀疏注意力生成,然后在一次并行的全注意力前向传播中验证;被接受的令牌被提交,注意力权重刷新稀疏索引,自适应模块根据逐令牌草稿熵选择最优 k*。

受上述统一加速比分析启发,理想的推测解码框架必须同时保持可接受的草稿开销 γ、保证稳健且可泛化的接受率 α,并动态校准推测长度 k。为满足这些标准,我们提出了 SparseSpec-L,一种免训练的自推测解码框架。它通过两种互补机制优雅地解决了这些瓶颈:可召回的稀疏注意力草稿。

相似文章

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

MicroSpec: 通过轻量级上下文词汇表加速推测解码

arXiv cs.CL

MicroSpec 是一种无需训练的技术,它能即时构建紧凑的上下文感知词汇表,以加速大型语言模型中的推测解码,将平均词汇表大小减少40倍以上,并相比EAGLE-2实现了高达1.32倍的端到端加速。