重新审视推测解码中的有损验证:机制、权衡与失效模式
摘要
本文分析了推测解码中的有损验证方案,将其分为基于截断的验证和协作验证两类,并指出了保持生成质量的陷阱和原则。
arXiv:2607.26627v1 公告类型:新
摘要:推测解码(Speculative Decoding, SD)通过允许轻量级草稿模型提出令牌,随后由较大的目标模型并行验证,从而加速大型语言模型推理。近期的研究引入了有损验证方案,通过放宽严格分布匹配来进一步提高效率。然而,这种放松会悄然改写解码分布,由此带来的加速可能以不稳定、有时严重降低的生成质量为代价。在本文中,我们对有损验证方法所诱导的分布进行了原则性分析。我们表明,许多看似不同的方法仅在表面上有所区别,可以分为两类:基于截断的验证和协作验证。我们进一步构建了一个诊断评估框架,涵盖多个精选基准。对于基于截断的方法,我们识别出一个根本性陷阱:由于分布扭曲,性能可能相比真正的截断采样基线显著下降。对于协作验证,我们发现了一个关键原则:控制草稿概率相对于目标概率的过冲对于防止低质量输出至关重要。我们的代码可在 https://github.com/ZhouYuxuanYX/Fast-HSD 获取。
查看缓存全文
缓存时间: 2026/07/30 09:58
# 重新审视推测解码中的有损验证:机制、权衡与失败模式
来源:https://arxiv.org/html/2607.26627
王天宇¹,周宇轩²††††,王文斌¹,李恒¹,肖子凯³,尚俊远²
¹独立研究者 ²百度公司 ³浙江大学
###### 摘要
推测解码(Speculative Decoding, SD)通过允许轻量级草稿模型生成候选词元,并由更大的目标模型并行验证,从而加速大型语言模型推理。近期的方法通过放宽严格分布匹配,引入有损验证机制以进一步提高效率。然而,这种放宽会悄然改写解码分布,加速可能以不稳定甚至严重退化的生成质量为代价。在本工作中,我们对有损验证方法诱导的分布进行了原则性分析。我们发现,许多看似不同的方法仅在表面上有所差异,可归纳为两类:截断式验证和协作式验证。我们进一步构建了一个跨精选基准的诊断评估框架。对于截断式方法,我们发现一个基本陷阱——由于分布失真,性能可能相对于真实截断采样基线显著下降。对于协作式验证,我们揭示了一个关键原则:控制草稿概率相对于目标概率的过冲(overshoot)对于防止低质量输出至关重要。我们的代码可在 https://github.com/ZhouYuxuanYX/Fast-HSD 获取。
---
# 重新审视推测解码中的有损验证:机制、权衡与失败模式
王天宇¹,周宇轩²†††††,王文斌¹,李恒¹,肖子凯³,尚俊远²
¹独立研究者 ²百度公司 ³浙江大学
## 1 引言
自回归大型语言模型(LLMs)[1–3] 处于人工智能革命的前沿。尽管性能强大,但其不可并行化的推理过程构成了显著的效率瓶颈,特别是在测试时扩展的长上下文生成[4,5]、LLM 智能体[6–8]及多模态推理[9]场景中。推测解码(SD)[10]通过让轻量级草稿模型生成候选词元,然后由目标模型并行验证,在确保生成分布与目标模型匹配的同时,减少昂贵的前向传播次数,从而缓解这一挑战。
参见图注
图 1:无损基线与截断式验证之间的准确率差距随任务难度急剧增大,从 GSM8K 的 +0.38 百分点增加到 AIME 的 +6.67 百分点。此处,“真实基线”指使用 min-p 采样的目标模型,而“错误基线”指未使用 min-p 采样的目标模型。
尽管理论进展已推动 SD 达到极限[11,12],但分布匹配的严格要求仍限制了进一步加速的潜力。有损验证方法[13–17]为获得更大加速而放宽这些要求,但现有工作往往在精心设计的设置(选择性超参数或简单基准)下夸大其优势。这掩盖了因目标分布扭曲而产生的真实速度-质量权衡,且不同方法之间缺乏清晰比较,阻碍了这些方法的广泛采用及该领域的进一步发展。
在本工作中,我们对有损验证方法诱导的分布进行了原则性分析,从而对其进行了精确分类。该分析揭示,方法间的表面差异大多是肤浅的,大多数方法分属两个不同类别。首先,诸如 Medusa [13] 中的典型接受(typical acceptance)和 SpecCascade [14] 等方法,只要候选词元落在由截断式采样方法(具体为 η-采样[18] 和 min-p 采样[19])定义的可接受集内,就接受该草稿词元。我们称这些为*截断式验证*方法。其次,宽容性松弛(lenience-based relaxation)[10,15] 和协同推测解码(CoS)[16] 均在草稿分布与目标分布之间进行插值,其关键区别在于插值系数是固定的还是在不同范围内自适应调整的。遵循 CoS [16] 的术语,我们将这些方法归为协作式验证方法,并将宽容性松弛统一纳入此范畴。
我们首先将截断式验证方法与其相应基线(即直接对目标模型使用相同的截断采样策略)进行比较。实验表明,先前工作[13,14]报告的表现相似主要源于其采用的截断采样方法改善了基线性能。此外,截断式验证与真实基线之间的性能差距随任务难度增大而扩大,如图 1 中 SpecCascade 所示。由于更难的任务更能反映现实场景,这一扩大的差距凸显了截断式验证在实践中的潜在陷阱。当有损验证方法集成到 EAGLE-3 推测解码系统[20]中时,这种陷阱被进一步放大,性能差距变得更为显著。
接下来,我们转向协作式验证,并识别出实现更好速度-质量权衡的关键原则:现有方法要么在 CoS [16] 中均匀插值草稿与目标分布,要么在宽容性松弛[10]中自适应插值,但我们发现,选择性地抑制过冲词元处的草稿分布就足以保持生成质量。这与近期发现[21–23]一致,即过冲词元驱动了大多数低质量生成,而分布的其他部分对质量影响很小。
总之,我们做出以下贡献:
- **原则性分类**:揭示看似不同方法之间的底层相似性——截断式验证和协作式验证,每种都由共同的底层机制诱导。
- **实证陷阱**:识别截断式验证的关键陷阱:分布失真可能使性能相对于真实截断采样基线显著下降。
- **主导原则**:揭示控制草稿概率相对于目标概率的过冲对于协作式验证在可接受质量下实现加速至关重要。
## 2 预备知识
我们首先介绍推测解码框架及其无损验证机制(第 2.1 节),这是许多有损方法的基础。然后回顾两种解码技术:协作式解码(第 2.2 节)和截断采样(第 2.3 节)。如第 3 节所示,这些技术构成了两类有损验证的基础。
### 2.1 推测解码
设 \(p\) 和 \(q\) 分别表示目标模型和草稿模型在共享词汇表 \(\mathcal{V}\) 上的下一个词元分布。在推测解码[10]中,从 \(q\) 中采样的每个草稿词元 \(x\) 以如下概率被接受:
\[
h(x) = \min\!\left(1,\;\frac{p(x)}{q(x)}\right). \tag{1}
\]
如果草稿词元 \(x\) 被拒绝,则从残差分布 \(\bigl(p(x)-\min\{p(x),\,q(x)\}\bigr)_{+}\) 中重新采样一个替换词元,并在 \(\mathcal{V}\) 上重新归一化,从而确保生成分布与目标分布 \(p\) 完全一致。后续工作通过提出多个候选或树状草稿[24–28]来提高接受率,而块级验证将无损保证扩展到词元序列[11,12]。由于无损验证已接近其理论极限,有损方法通过修改接受准则来实现进一步加速:有些放宽了式 (1) 中的参考分布[10,15,16],而另一些则通过源自截断采样的集合成员资格准则来控制接受[13,14]。尽管有这些进展,有损方法的底层机制及其速度-质量权衡仍未被很好理解,我们将在第 3 节中解决这一问题。
### 2.2 协作式解码
协作式解码结合多个模型的预测,形成重塑后的下一个词元分布。使用第 2.1 节定义的目标分布 \(p\) 和草稿分布 \(q\),并令 \(\lambda \in [0,1]\) 表示插值系数,加权集成(WE)[29,30] 将下一个词元概率计算为凸组合:
\[
p_{\mathrm{WE}}(x) = \lambda\,p(x) + (1-\lambda)\,q(x). \tag{2}
\]
对比解码(CD)[31,32] 则利用从 \(q\) 导出的对比因子重新加权 \(p\):
\[
p_{\mathrm{CD}}(x) = \frac{p(x)/q(x)^\lambda}{\sum_{v\in\mathcal{V}}p(v)/q(v)^\lambda}. \tag{3}
\]
标准的推测解码旨在匹配目标分布,而协同推测解码(CoS)[16] 则将其中一种组合分布作为验证目标,从而获得额外加速。
### 2.3 截断采样
截断采样在每个解码步骤将词汇表限制为由截断策略 \(\Theta\) 确定的允许集合 \(\mathcal{A}_\Theta \subseteq \mathcal{V}\),丢弃低概率词元以减少不连贯输出的风险。令 \(Z_\Theta(p) = \sum_{v\in\mathcal{A}_\Theta} p(v)\) 为归一化常数。所得分布为:
\[
p_\Theta(x) =
\begin{cases}
\dfrac{p(x)}{Z_\Theta(p)}, & x \in \mathcal{A}_\Theta, \\[2.0pt]
0, & x \notin \mathcal{A}_\Theta.
\end{cases} \tag{4}
\]
两种代表性策略——min-p 采样[19]和 η-采样[18]——描述如下:
参见图注
图 2:协作式方法与截断式方法诱导的分布比较。词元按目标概率降序排列。蓝色和粉色条分别表示目标分布 \(p\) 和草稿分布 \(q\);橙色表示两者的重叠区域。紫色线表示输出分布。灰色虚线表示上限。
**Min-p 采样** 根据顶部候选的置信度自适应地应用相对于峰值概率的动态截止值,其中 \(p_{\text{base}} \in (0,1)\):
\[
\mathcal{A}_{\text{min-p}} = \bigl\{ x \in \mathcal{V} : p(x) \geq p_{\text{base}} \cdot \max_{v\in\mathcal{V}} p(v) \bigr\} \tag{5}
\]
**η-采样** 根据模型不确定性自适应地移除低于由分布熵 \(H(p) = -\sum_{v\in\mathcal{V}} p(v) \log p(v)\) 导出的阈值的词元,其中 \(\varepsilon, \delta > 0\):
\[
\mathcal{A}_\eta = \bigl\{ x \in \mathcal{V} : p(x) \geq \min\!\left(\varepsilon,\,\delta e^{-H(p)}\right) \bigr\} \tag{6}
\]
在第 3 节中,我们将展示最先进的有损验证方法[14,13]本质上只要草稿词元落在由这些截断策略之一定义的允许集合内,就接受该词元。
## 3 有损验证的机制
在本节中,我们展示现有有损验证方法属于两种范式:**协作式验证**,通过匹配来自协作式解码的组合分布来放宽验证;以及**截断式验证**,基于截断采样诱导的允许集合接受草稿词元。
### 3.1 协作式验证
协作式验证放宽接受准则,使得生成分布成为草稿分布与目标分布的组合,从而以性能下降为代价提高解码速度。这一观点涵盖了相似文章
Dustin: 草稿增强的稀疏验证用于高效长上下文生成与推测解码
Dustin提出了一种用于推测解码的稀疏验证框架,利用草稿模型信号和稀疏注意力头评分克服KV缓存验证瓶颈,在长上下文任务中自注意力加速达27.85倍,端到端解码加速达9.17倍,且精度损失可忽略不计。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
Mistletoe:针对推测解码的隐蔽加速崩溃攻击
本文识别了基于模型的推测解码在大语言模型中的新漏洞:微小扰动可以在不影响输出质量的情况下降低草稿令牌接受率,从而使加速效果崩溃。作者提出了Mistletoe攻击,该攻击联合优化退化与语义保持,展示了在各种系统上显著的加速降低效果。
@ziv_ravid: https://x.com/ziv_ravid/status/2076074598618083627
解释了 DSpark 论文对推测解码的改进,以加速 LLM 推理,重点在于长草稿生成和自适应验证。
VIA-SD: 基于模型内路由的投机解码验证
VIA-SD 提出了一种多层次的投机解码框架,通过模型内路由降低验证成本,相比传统方法实现了显著的加速。