边距而非窗口:无训练的每步有损推测解码
摘要
AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。
查看缓存全文
缓存时间: 2026/09/04 05:52
# 边界而非窗口:无训练逐步骤有损推测解码 来源:https://arxiv.org/html/2609.02897 Oszkár Urbán1 Young D. Kwon1,2 Stylianos I. Venieris2 Cecilia Mascolo1 1剑桥大学 2三星AI中心-剑桥,英国 ###### 摘要 推测解码通过起草候选令牌并行验证来加速大语言模型推理。树状注意力起草器如EAGLE-3已被广泛采用,但通常固定两个决策:(1) 严格的令牌匹配验证规则,(2) 静态的草稿树形状。先前工作在有限假设下分别放宽这两点:针对无训练有损验证的长草稿链,以及在固定令牌预算下的自适应树形调整。我们引入AdaptiveSpec,这是一种无训练的逐步骤推测解码方法,它根据解码过程中已产生的内部信号自适应调整这两个决策。逐步骤边界规则在目标模型对草稿令牌的概率与其最高概率之比超过阈值时,会提升一个不匹配的草稿提议令牌,无需依赖草稿长度或底层起草器架构。逐步骤树策略直接从草稿最高概率与捕捉近期草稿-目标一致性的滚动接受历史融合信号中调整草稿树的深度、宽度和节点数,允许总草稿数量变化而非仅重新分配。两种自适应操作在正交轴上并产生复合效应。在SGLang生产级服务引擎上实现,AdaptiveSpec在三个目标模型(DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8B)上,在GSM8K、MATH-500和HumanEval任务中,比最先进自回归推测解码方法EAGLE-3的吞吐量提高了高达56%,并恢复了93%至完全无损的任务准确性。 边界而非窗口:无训练逐步骤有损推测解码 Oszkár Urbán1††感谢:通讯作者:[email protected] Young D. Kwon1,2 Stylianos I. Venieris2 Cecilia Mascolo1 1剑桥大学 2三星AI中心-剑桥,英国 ## 1引言 大语言模型现已在自然语言处理及其他领域广泛应用,解决多样任务(Agarwal等, 2025; Kamath等, 2025)。然而,其自回归设计从根本上限制了推理效率:每个令牌的生成都需要一次必须等待前一个令牌的前向传播。随着模型规模扩大,这一开销增长,尤其在链式思维推理模型(DeepSeek-AI, 2025)中尤为明显,这些模型常产生长于最终答案本身的长中间“思考”轨迹,且在最终答案生成后即被丢弃。 推测解码(Leviathan等, 2023; Chen等, 2023)在保持目标模型输出分布的同时解决了这一自回归局限。它遵循先起草后验证的模式:一个轻量级*起草*模型提出多个候选令牌,而*目标*模型在一次前向传播中并行验证它们,以一次前向传播的成本生成正确预测的令牌,而非每个令牌一次前向传播。树状注意力起草器(Li等, 2024; Ringel and Romano, 2026)是该模式的广泛采用实现:在每一步,它们提出一个候选草稿令牌树,允许多种延续。 近期工作在两个方面改进推测解码:放宽验证器接受规则,以及调整草稿树形状。在*验证器*方面,方法将接受标准从严格令牌匹配放宽至语义等价,以适度准确性损失提高吞吐量:需要训练的验证器方法(Bachmann等, 2025; Dong等, 2026)从标记或生成数据学习外部模块,而无需训练的方法FLy(Li等, 2026)仅当下一个W个令牌(通常W=6)的下游窗口内无进一步不匹配时,才将不匹配令牌视为语义等价。然而,在EAGLE-3上,每令牌接受率随草稿深度下降,在深度7-9时低于10%,因此该大小的窗口很可能包含不匹配。因此,FLy在EAGLE-3上的放宽带来的净加速很少,甚至可能低于静态基线。在*起草器*方面,互补的一系列工作调整草稿树的形状和大小,基于观察:置信步骤更受益于深链,而不确定步骤需要宽树替代方案。最接近的代表TALON(Liu等, 2026)根据置信度在线调整树形,在容易步骤产生更深的树,在困难步骤产生更宽的树。然而,适应发生在总令牌预算内,TALON在深度和宽度间重新分配节点计数,而非直接调整草稿树深度和宽度(nsteps, top-k)。 在本工作中,我们通过引入AdaptiveSpec解决这两项限制,这是一种无训练的、逐步骤自适应推测解码框架,完全由解码期间已计算的内部信号驱动。首先,我们提出一种新颖的逐步骤有损验证规则,当目标模型对草稿令牌的概率与其最高概率之比超过阈值时,提升不匹配的草稿令牌,无需辅助训练或外部验证器判断语义等价,即可在最小准确性损失下实现更高吞吐量。其次,我们提出动态草稿树形状调整,直接基于草稿最高概率与滚动接受历史的融合信号,调整控制草稿树形状的三个超参数,而非在固定预算下增长。此外,我们将这两个轴整合为一个统一解决方案AdaptiveSpec,进一步复合提高吞吐量。我们的主要贡献总结如下: 1. 1.我们提出一种新颖的、无训练的、有损验证规则,仅使用目标模型对不匹配位置草稿令牌的概率与其最高概率之比来提升不匹配草稿令牌,无需草稿链长度要求,适用于任何起草器。 2. 2.我们引入一种动态树形调整策略,直接在每个解码步骤调整控制草稿树形状的所有三个起草器超参数,由草稿置信度与滚动接受率的组合驱动。 3. 3.我们将这些组件整合为AdaptiveSpec,一种统一的、无训练的、内部信号驱动的自适应推测解码方法,在保持93%至完全无损下游任务准确性的同时,比EAGLE-3基线平均提高目标模型吞吐量18-44%。AdaptiveSpec的两个提出组件在其各自领域独立优于最先进(SOTA)推测解码。 ## 2相关工作 #### 推测算解码. 推测解码(Leviathan等, 2023; Chen等, 2023)通过起草和验证方法打破自回归解码的序列依赖。一个快速*起草*模型提出γ个候选令牌,*目标*模型在一次前向传播中验证它们。由于验证并行运行,每次目标前向传播最多接受γ个起草令牌。树形起草器通过每步提出*树*状候选而非链状来扩展此模式,将多个延续暴露给同一验证传递,提高预期接受长度(Miao等, 2024; Cai等, 2024; Ankner等, 2024; Du等, 2024; Xiao等, 2024)。我们采用最先进自回归EAGLE-3(Li等, 2025)作为起草器。每个EAGLE-3解码步骤交替两个阶段:(i) 起草:起草模型执行nsteps步前向传播,每个节点分支topk种方式,并剪枝至验证预算ndt个令牌;(ii) 验证:目标模型接受与其自身分布一致的提议令牌。因此三元组(nsteps, top-k, ndt)控制草稿树形状和每步计算量。 #### 自适应草稿树. 近期研究表明,没有单一草稿树在所有生成中都最优;某些步骤受益于深链,而其他步骤受益于宽分支树。为解决此问题,多项工作专注于在运行时调整树形(Zhang等, 2024; Xiong等, 2024; Huang等, 2025; Mamou等, 2024; Huo等, 2025; Liu等, 2025; Gao等, 2025)。EAGLE-2(Li等, 2024)重新排序填充固定大小树预算的令牌。OPT-Tree(Wang等, 2025a)在每个解码步骤重新解决树拓扑以在固定节点预算内最大化预期接受长度,而Sequoia(Chen等, 2024)通过动态规划离线优化树,针对给定起草-目标对和硬件设置。 最接近我们动态树形调整轴的是TALON(Liu等, 2026),它通过置信度门控扩展规则在线调整树形:在根节点固定topK初始化后(以缓解早期拒绝),更深层仅保留并进一步扩展那些草稿概率在该层最置信令牌阈值比率内的候选令牌,增长树直至达到固定全局令牌预算。这在起草器置信时产生深拓扑,不置信时产生宽拓扑。限制是适应发生在该全局令牌预算内:TALON仅在深度和宽度间重新分配总节点数,无法直接调整总草稿计算量。此外,由于未集成到SGLang等高性能推理引擎中,尚不清楚TALON的性能增益能否在高度优化的生产设置中保持。 我们的AdaptiveSpec直接解决这两项限制。它联合调整所有三个EAGLE-3起草器超参数(nsteps, top-k, ndt),在每个解码步骤基于结合起草器最高概率和运行接受率的置信度信号。由于候选三元组跨越不同总节点数,该策略在弱草稿步骤真正收缩草稿计算,而不仅仅重新分配预算。我们在SGLang内实现此功能,保持其生产级性能。 #### 有损验证. 现有工作研究如何放宽严格接受标准以接纳目标认为近乎等价的不匹配,以小准确性损失提高接受率(Sun等, 2025; Garipov等, 2025; Wang等, 2025b)。Judge Decoding(Bachmann等, 2025)和SemanticSpec(Dong等, 2026)表明,外部验证器(判别分类器或对目标隐藏状态的语义探针)可以识别并接受此类不匹配,同时保持有竞争力的任务准确性;它们的主要限制是该模块必须*训练*,因此对新数据集和任务的迁移性有限。 无需训练的FLy(Li等, 2026)改为在熵门条件通过*且*下一个W个令牌的前瞻窗口显示无进一步不匹配时提升不匹配,设计为让前瞻窗口替代训练验证器。 前瞻窗口基于以下理念:当大语言模型以真正不正确的令牌为条件时,它们倾向于在后续生成步骤中自我纠正(Pan等, 2023)(在Judge Decoding中称为错误令牌模式(Bachmann等, 2025))。在位置j的不匹配处,FLy通过熵门后跟W个令牌的前瞻窗口实现;如果该窗口内无进一步不匹配,则原始令牌被视为语义等价并保留。否则,后续不匹配信号自我纠正,触发回滚。 然而,此前瞻窗口不能干净地转移到所有推测起草器(§4.4)。特别是当平均接受率低时,后续不匹配不一定是目标纠正先前错误的证据,而是草稿-目标松散耦合的后果。此外,窗口结构上与EAGLE-3等起草器不兼容,其平均接受长度短于FLy窗口W规则期望的长草稿链(K=15–25)。 我们提出的AdaptiveSpec通过读取目标模型在不匹配位置的概率分布回避了这两个问题:直接、单位置测量,独立于接受令牌长度和任何高级自我纠正概念。它无需前瞻和训练模块,仅需验证传递已保持的目标和草稿概率分布。与Judge Decoding和SemanticSpec不同,它不产生训练成本;与FLy不同,它不对草稿长度或自我纠正模式做结构性假设。 ## 3方法 #### 问题形式化. 大语言模型每次前向传播生成一个令牌:给定先前令牌x<t=(x1,...,xt−1),令牌xt从词汇表上的条件分布pθ(xt|x<t)采样。因此生成是顺序的;每一步必须等待前一步完成,解码延迟随输出长度线性缩放(Pope等, 2022)。这种序列依赖是推测解码旨在解决的瓶颈。 ### 3.1概述 AdaptiveSpec是一个具有两个自适应轴的单一系统,每个轴对应EAGLE-3解码步骤的一个阶段(起草和验证),仅由解码步骤期间已产生的内部模型信号驱动,无需辅助训练。第一个轴在每步重塑草稿树,由草稿置信度信号驱动;第二个轴使用目标模型的概率分布边界放宽验证规则。 - •起草自适应
相似文章
整体之稀疏一瞥:无需训练的自推测解码
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization
Presents LibraSpec, a training-free, plug-and-play algorithm that dynamically selects speculative decoding lengths via marginal-gain-driven optimization, achieving consistent speedups across multiple models and benchmarks.
AngelSpec:面向实际场景的高性能推测解码推理
AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。
AdaPLD:自适应检索与复用的高效无模型推测解码方法
AdaPLD是一种无需训练的方法,通过自适应检索结合词汇与语义相似度,并构建分支复用假设来处理续写不确定性,从而提升无模型推测解码的效率,最高可实现3.10倍解码加速。
[研究] JetSpec:通过并行树草案实现推测解码,最高可达9.64倍无损LLM推理加速,超过1000TPS
JetSpec引入了并行树草案技术用于推测解码,在保持无损准确性的同时,实现了LLM推理高达9.64倍的端到端加速,单块B200 GPU上吞吐量达到约1000 TPS。