基于推测词汇表的推测解码
摘要
本文提出SpecVocab,一种为推测解码中的草稿模型逐步骤选择词汇子集的方法,实现了更高的接受长度,并相较于EAGLE-3最高提升8.1%的吞吐量。
arXiv:2602.13836v2 公告类型:替换
摘要:推测解码已迅速成为加速语言模型推理的主流方法,因为它能在保持输出一致的同时显著提升速度。这依赖于一个小的草稿模型,其任务是预测目标模型的输出。最先进的推测解码方法使用一个由单解码层和输出嵌入矩阵组成的草稿模型,而输出嵌入矩阵在最新语言模型中占据主导的起草时间。最近的工作试图通过减小草稿模型的词汇量来解决这一输出分布瓶颈。虽然这可以提高吞吐量,但当目标标记超出词汇量时会损害推测效果。在本文中,我们主张将词汇推测作为减小词汇量的替代方案。我们提出SpecVocab,一种高效且有效的方法,在每个解码步骤选择词汇子集。在多种任务上,我们展示了SpecVocab能够比最先进的推测解码方法EAGLE-3达到更高的接受长度。值得注意的是,相较于EAGLE-3,这平均吞吐量提升了高达8.1%。
查看缓存全文
缓存时间: 2026/07/20 09:38
# 基于推测词汇表的推测解码 来源:https://arxiv.org/html/2602.13836 Miles Williams¹², Young D. Kwon², Rui Li², Alexandros Kouris², Stylianos I. Venieris² ¹谢菲尔德大学 ²三星AI中心,剑桥,英国 通讯作者:[email protected] (mailto:[email protected]) ###### 摘要 推测解码已迅速成为加速语言模型推理的主流方法,因为它能在保持相同输出的同时显著加速。这依赖于一个小型草稿模型,负责预测目标模型的输出。最先进的推测解码方法采用仅包含一个解码层和输出嵌入矩阵的草稿模型,其中输出嵌入矩阵在最新语言模型中主导了草稿生成时间。近期工作试图通过减小草稿模型的词汇量来解决这一输出分布瓶颈。虽然这能提升吞吐量,但当目标词元不在词汇表中时,会损害推测效果。在本文中,我们主张将词汇推测作为减小词汇量的替代方案。我们提出SpecVocab,一种高效且有效的方法,能在每个解码步骤中选择一个词汇子集。在各种任务上,我们证明SpecVocab能比最先进的推测解码方法EAGLE-3实现更高的接受长度。值得注意的是,相比EAGLE-3,这带来了高达8.1%的平均吞吐量提升。¹¹https://github.com/SamsungLabs/SpecVocab 基于推测词汇表的推测解码 Miles Williams¹², Young D. Kwon², Rui Li², Alexandros Kouris², Stylianos I. Venieris² ¹谢菲尔德大学 ²三星AI中心,剑桥,英国 通讯作者:[email protected] (mailto:[email protected]) ## 1 引言 尽管大语言模型能力惊人(Kamath et al.,2025;Yang et al.,2025;Agarwal et al.,2025),但其自回归设计仍限制了推理效率。推测解码已成为一种重要的加速推理方法,同时保持输出完全一致(Xia et al.,2024)。传统上,推测解码将期望的*目标*模型与一个较小的*草稿*模型结合。草稿模型快速生成一系列候选词元,然后通过目标模型的单次前向传播并行验证(Leviathan et al.,2023;Chen et al.,2023)。当代推测解码方法采用轻量级草稿模型以实现高效草稿生成(Miao et al.,2024;Cheng et al.,2024;Wertheimer et al.,2024;Li et al.,2024b,a,2025b;Zhang et al.,2025)。然而,Zhao等人(2025)最近指出,在广泛采用的EAGLE推测解码框架(Li et al.,2024a)中,草稿生成的大部分时间花在计算目标词汇表上的输出分布上。这带来了一个重大问题,因为语言模型的词汇量仍在持续增大(Tao et al.,2024;Huang et al.,2025;Takase et al.,2025)。为缓解草稿生成中的词汇瓶颈,近期工作尝试利用自然语言的齐夫分布(Zipf,1949)。理论上,罕见词元被目标模型预测的可能性较小,因此可以从草稿模型词汇表中排除。FR-Spec(Zhao et al.,2025)、EAGLE-3(Li et al.,2025b)和VocabTrim(Goel et al.,2025)均采用目标模型词汇表的固定子集来降低词汇投影的延迟。然而,当下一个词落在这个子集之外时,当前及后续草稿词元将被拒绝,从而消除推测解码带来的加速。 见注释 图1:*词汇推测*通过仅计算词汇表中与上下文相关的子集的输出分布来加速推测解码。 在本文中,我们主张推测解码不仅应对下一个词元进行推测,*还应对输出词汇表进行推测*(图1)。与早期方法相比,这既能降低计算输出分布的成本,又能更好地保留接受的草稿词元数量。我们的核心贡献如下: 1. 我们提出SpecVocab,一种高效的方法,用于预测与下一个词元上下文相关的词汇子集。 2. 在各种任务上,SpecVocab实现了比静态词汇方法(如EAGLE-3、FR-Spec和VocabTrim)更高的接受长度。这使平均吞吐量比EAGLE-3提升高达8.1%。 3. 我们实现并基准测试了一个自定义内核,可将词汇子集的logits计算加速高达5倍。 4. 我们通过实验证明,EAGLE-3(Li et al.,2025b)中引入的简化词汇草稿模型训练过程可能不必要地损害草稿模型性能。 见注释 图2:推测解码草稿模型架构概览。EAGLE-2在整个目标模型词汇表上形成预测,而EAGLE-3使用固定子集,类似FR-Spec和VocabTrim。相比之下,SpecVocab(我们的方法)在每个解码步骤推测使用目标模型词汇表的哪个子集。 ## 2 相关工作 #### 词汇表示。 近期语言模型采用越来越大的子词词汇表。早期的基于Transformer的语言模型如BERT(Devlin et al.,2019)和GPT-2(Radford et al.,2019)分别使用30K和50K词元的词汇表。相比之下,较新的模型如OLMo 2(Walsh et al.,2025)和Qwen3(Yang et al.,2025)采用了更大的词汇表,分别为100K和152K。近期工作强调了使用如此大规模词汇表预训练语言模型的性能优势(Tao et al.,2024;Huang et al.,2025;Takase et al.,2025)。 #### 推测解码。 推测解码的核心机制是提出多个词元,并从最长正确前缀继续生成(Stern et al.,2018;Sun et al.,2021)。这已普及为“先草稿后验证”模式,使用高效的草稿模型,同时保留目标模型的输出分布(Xia et al.,2023;Leviathan et al.,2023;Chen et al.,2023)。近期推测解码方法探索了使用辅助头(Cai et al.,2024;Ankner et al.,2024)、上下文嵌入(Gritta et al.,2025)、中间隐藏状态(Cheng et al.,2024;Li et al.,2025b)以及树状草稿生成(Spector and Re,2023;Li et al.,2025b)。特别是EAGLE系列推测解码方法(Li et al.,2024b,a,2025b)已被广泛采用,无论是在流行的推理引擎(Kwon et al.,2023;Zheng et al.,2024)中还是在大规模应用中(Tang et al.,2025)。 #### 简化词汇草稿模型。 尽管推测解码方法力求最大化草稿模型的效率,但在模型词汇表上计算输出分布的开销依然存在。Zhao等人(2025)首先发现了推测解码草稿模型中的输出分布瓶颈。他们提出了FR-Spec,该方法通过剪枝不常见词元的嵌入来利用自然语言频率分布的长尾特性(Zipf,1949)。与此同时,Goel等人(2025)独立提出了VocabTrim,同样基于词元频率剪枝输出嵌入矩阵。与FR-Spec建议使用大规模预训练语料库(Soboleva et al.,2023)计算词元频率不同,VocabTrim利用目标模型生成的合成数据。最后,EAGLE-3(Li et al.,2025b)也采用了基于目标模型合成数据的简化词汇表。不过,其输出嵌入矩阵是重新训练的,而非训练后剪枝。Zhao等人(2025)发现32K的词汇量能提供最佳吞吐量,这一词汇量也被EAGLE-3采用。然而,固定的词汇子集本质上是与上下文无关的,当输出词元落在子集之外时会导致次优性能。我们的工作通过上下文感知的词汇推测解决了这一问题,在每个解码步骤选择相关的子集。 ## 3 词汇推测 ### 3.1 预备知识 推测解码通过引入轻量级草稿模型 \(q\) 来加速自回归生成,该模型生成候选序列,随后由目标模型 \(p\) 验证。草稿模型有一个输出嵌入矩阵(即语言模型头)\(\mathbf{U} \in \mathbb{R}^{|\mathcal{V}| \times d}\),其中 \(|\mathcal{V}|\) 是目标模型的词汇表大小,\(d\) 是草稿模型的维度。在每个解码步骤 \(t\),草稿模型产生 logits \(\mathbf{z}_t = \mathbf{U} \mathbf{h}_t\),其中 \(\mathbf{h}_t\) 是草稿模型的最终隐藏状态。这些 logits 随后用于形成下一个词元的概率分布 \(q(x_t \mid x_{<t})\)。给定上下文 \(c\),应评估哪个词汇子集 \(\mathcal{K} \subset \mathcal{V}\) 来支持准确解码?该子集 \(\mathcal{K}\) 应紧凑,满足 \(|\mathcal{K}| \ll |\mathcal{V}|\),同时为采样器可能从 \(p(x_t \mid x_{<t})\) 中选择的词元提供足够的覆盖率。
相似文章
MicroSpec: 通过轻量级上下文词汇表加速推测解码
MicroSpec 是一种无需训练的技术,它能即时构建紧凑的上下文感知词汇表,以加速大型语言模型中的推测解码,将平均词汇表大小减少40倍以上,并相比EAGLE-2实现了高达1.32倍的端到端加速。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
跨语言的推测解码
本文比较了三种策略以提高非英语语言的推测解码效率,发现任务特定蒸馏能提高接受率但泛化性差,而n-gram草稿模型尽管接受率较低,却能提供持续的加速。
减少草稿,增加检索:用于推测解码的混合树构建
Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。
BudgetDraft:面向稀疏KV投机解码的接受感知多视图训练
BudgetDraft提出了一种多视图训练方法,用于投机解码,将稀疏KV起草者与全KV验证者对齐,在中长上下文推理中实现了显著的加速。