自推测加速推理模型

arXiv cs.CL 论文

摘要

本文介绍了SSR,一种无需训练的自推测解码方法,利用思维链来加速大语言模型中的推理,在结构化生成任务上实现高达24.1%的延迟减少。

arXiv:2608.20359v1 Announce Type: new 摘要:大语言模型(LLMs)被部署于涉及规划和多步骤决策的日益复杂的任务中,但要在这些任务上实现高性能,通常需要生成长的推理链。这对于延迟敏感和交互式应用,如语音助手或编程代理来说并不合适,因为生成延迟会严重影响用户体验。现有的加速方法通常侧重于词元级生成,而未利用推理工作流的结构。我们介绍了SSR:推理模型的自推测,一种无需训练的自推测解码方法,利用思维链(CoT)作为推测源。SSR使用部分CoT答案分布作为起草器,完整CoT分布作为验证器,两者都源自同一模型在不同推理预算下的输出。这基于观察到后续的部分CoT响应通常与完整预算响应在语义和词汇上具有更大的重叠。由于这种重叠,SSR可以一次接受长的草稿前缀,从而在结构化和长文本生成任务上实现大幅加速。为了进一步利用超出标准推测解码所接受的连续前缀的草稿-响应重叠,SSR还结合了后缀解码,使用草稿来填充后缀缓存并恢复超出接受前缀的有用片段,进一步减少在草稿和最终响应之间具有高词汇重叠的任务上的延迟。我们在多个SSR最有用的结构化和长文本生成任务上评估了SSR,并展示了对于流行开源模型如Qwen3.5和Gemma-4,总生成延迟相对改进高达24.1%。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:10

# 推理模型的自投机加速方法  
来源:https://arxiv.org/html/2608.20359  
Ravisri Valluri 加州大学洛杉矶分校 [email protected]  
Tung Nguyen 加州大学洛杉矶分校  
Aditya Grover 加州大学洛杉矶分校  

###### 摘要  
大型语言模型(LLMs)正被应用于日益复杂的任务,这些任务涉及规划与多步决策。然而,要在这些任务上获得高性能,通常需要生成长篇推理过程。这对于延迟敏感和交互式的应用(如语音助手或编程智能体)并不友好,因为生成延迟会显著影响用户体验。现有的加速方法通常关注令牌级的生成,而未能利用推理工作流的结构特性。我们提出 SSR(推理模型的自投机方法)——一种无需训练的自投机解码方法,它利用思维链(CoT)作为投机来源。SSR 将部分 CoT 对应的答案分布作为草稿器,将完整 CoT 的分布作为验证器,两者均来自同一模型在不同推理预算下的输出。这一方法基于一个观察:较后的部分 CoT 回应往往在语义和词汇上与完整预算回应具有更高的重叠度。由于这种重叠,SSR 可以一次性接受长段草稿前缀,从而在结构化和长篇生成任务中实现显著加速。为了进一步利用超出标准投机解码所接受的连续前缀的草稿-回应重叠,SSR 还引入了后缀解码:利用草稿构建后缀缓存,并恢复超出已接受前缀的有效片段,从而在草稿与最终回应词汇高度重叠的任务中进一步降低延迟。我们在多个结构化和长篇生成任务上评估了 SSR,这些任务最适合展示其优势,并在开源模型如 Qwen3.5 和 Gemma-4 上展示了最高 24.1% 的总生成延迟相对提升。代码已发布于 https://github.com/Ravi-VVK/SSR/ 。  

## 1 引言  
推理语言模型正将 LLMs 推向超越短程辅助的领域,进入需要持续问题解决的任务,包括规划、编程和决策。这类模型通过生成长达数千个令牌的长篇推理过程来提升最终回应的质量。虽然这提高了答案质量,但也增加了端到端的生成延迟,使其难以应用于需要快速响应的场景。这在交互式环境中尤为突出,例如聊天机器人、语音助手和编程智能体,较长的延迟会损害用户体验。在此类场景中,如果额外的计算能降低端到端延迟,那么投入这些计算往往是值得的。  
投机解码(Speculative decoding)天然适合这一场景。在标准投机解码中,草稿模型(draft model)会提议多个未来令牌,然后由目标模型(target model)并行验证(Leviathan et al., 2023; Chen et al., 2023)。当草稿准确时,验证器可以一次性接受多个令牌,从而减少顺序解码的步骤。主要挑战在于构建一个既生成成本低又足够准确、能被目标模型接受大部分令牌的草稿。先前关于投机解码的研究采用了不同的草稿模型选择方法。完全独立的草稿模型是自然的基线,但它会带来显著开销,因为草稿模型需要单独训练、与目标模型一起驻留内存,并经过仔细优化以匹配目标模型的输出分布。  
一类工作(包括 Medusa(Cai et al., 2024)和 EAGLE(Li et al., 2024))通过训练轻量级草稿头或复用目标模型部分参数的小模块来减少这种开销,但仍然需要训练和架构修改。另一类工作则完全避免辅助参数,直接从目标模型自身进行草稿生成,例如使用早期层(Elhoushi et al., 2024; Liu et al., 2024)、稀疏注意力(Yue et al., 2026; Zhao et al., 2025)、量化(Tiwari et al., 2025)或其他对目标模型内部计算的近似。基于量化和稀疏注意力的自投机解码变体通常可以完全无需训练。  
在光谱的另一端,无模型方法(Saxena, 2023; Oliaro et al., 2024; Hu et al., 2025)使用 n-gram 查找或后缀结构从提示或先前生成中复制文本。这些方法完全消除了草稿模型的调用,但无法生成新内容或适应模型当前的推理状态。虽然所有这些方法都能有效降低解码延迟,但它们并未充分利用推理语言模型的结构特性。  
推理语言模型为投机提供了额外的信号来源:思维链本身。关于测试时缩放(test-time scaling)的研究表明,可以通过预算强制和反思来控制 CoT 的长度(Muennighoff et al., 2025),并且增加推理预算通常能提高答案质量(至少在一定程度上)。这表明部分 CoT 并非完全任意的不完整状态,它们可以诱导出有意义的中间答案分布。在 CoT 早期采样得到的答案可能不完整或不一致,但随着推理的进行,其质量会提高,并在内容和表面形式上越来越接近最终答案。  
这一特性为草稿生成提供了自然的基础,而先前的工作尚未利用这一点。参考图 1 说明:图 1 自投机解码中的并发生成示意图。低预算实例在草稿生成答案令牌,同时更高预算的推理过程并行继续。然后,验证器接受与更高预算分布一致的最长草稿前缀;在第一个被拒绝的令牌之后,生成将在验证器下继续进行。  
我们利用这一特性提出了 SSR:推理模型的自投机方法。这是一种自投机解码方法,使用部分 CoT 诱导的答案分布作为草稿分布。同一语言模型在两种不同的推理预算下使用:中间 CoT 前缀生成草稿答案令牌,而完整的 CoT 则充当验证器。草稿生成和继续推理是并发进行的,因此草稿生成开销被正在进行的 CoT 生成所掩盖(图 1)。由于草稿分布随着 CoT 的增长而收敛于最终答案分布,SSR 无需辅助参数或针对目标模型的特定修改。在精确验证下,输出质量保持不变。当草稿被接受时,延迟降低;当草稿被拒绝时,模型以极小的开销回退到标准解码。这使得 SSR 可以在任何推理模型中无缝替代标准解码。  
我们从左到右进行草稿验证,以接受草稿与最终答案之间最长的匹配前缀。在结构化任务中,模型在推理早期就确定了广泛结构,因此在 CoT 中途采样的草稿通常与最终回应共享大量重叠。然而,对于长篇输出,两个回应可能在早期变量名或措辞选择等细节上不一致,但在文本的后半部分仍然达成共识。在第一个被拒绝的令牌处丢弃草稿会浪费这种重叠。因此,我们在前缀验证阶段之后引入后缀解码:从草稿构建后缀缓存,并用它提议可能仍然匹配的片段,从而恢复标准验证通常会丢弃的有效文本。  
如果草稿接受率随 CoT 长度单调增加,那么最佳采样点应恰好留下足够数量的 CoT 令牌来掩盖草稿生成的开销,从而尽可能晚地开始采样草稿。在实践中,这个理想点无法预先得知,因为它取决于总 CoT 长度。这促使我们引入 SSR 的迭代变体:在 CoT 生成过程中采样多个点的草稿。早期草稿不会被浪费——我们应用相同的验证程序,从早期草稿引导(bootstrap)后期草稿,从而减少多点采样的开销,并增加至少一个草稿与最终答案高度重叠的可能性。  
总之,我们的贡献如下:  
- 我们提出 SSR,这是一种针对推理语言模型的无需训练的自投机解码方法,它使用部分 CoT 诱导的答案分布作为草稿,无需辅助参数或针对目标模型的特定修改。  
- 我们将标准草稿验证扩展至包含后缀解码,以恢复超出第一个不匹配点的有效草稿片段,提高长篇和结构化输出的接受率。  
- 我们引入了一种迭代变体,在 CoT 生成过程中采样多个点的草稿,利用早期草稿引导后期草稿,从而减少多点采样的开销。  
- 我们在 vLLM 中提供了实现,将 SSR 作为现有服务配置的即插即用补充,无需更改模型权重或推理基础设施。  
- 我们在编程和长篇生成任务(包括 HumanEval、ClassEval 和 LongProc)上进行了评估,在保持输出质量的同时,实现了最高 24.1% 的延迟降低。  

## 2 相关工作  
### 2.1 投机解码  
自回归语言模型生成延迟的主要驱动因素是解码步骤,它在大量令牌上重复进行。投机解码通过使用更便宜的草稿模型提前提议多个令牌来降低这一成本,然后由目标模型并行验证。在其精确形式中,它使用拒绝采样(rejection sampling)来确保最终采样分布与目标模型完全相同。如果多个草稿令牌被接受,这可以显著减少目标模型所需进行的昂贵解码步骤数量。这一工作线(Leviathan et al., 2023; Chen et al., 2023)最初作为无损加速方法提出,但后来扩展到包括有损变体,例如无模型投机解码(不一定将采样概率与草稿令牌关联)以及验证的原理性松弛(Zhong et al., 2025),后者甚至可以实现更高的加速增益。  

#### 草稿模型构建  
投机解码提供的加速效果是草稿生成开销和接受率的函数。要使投机解码加速生成,草稿模型必须运行成本低且足够接近目标模型以维持高接受率。在开源社区中,通常使用旗舰模型的小型蒸馏变体作为草稿模型,特别是当目标模型达到数百亿或数千亿参数时。但当资源有限时,并且由于草稿模型也占用大量内存,许多流行方法通过在草稿和目标模型之间共享参数和计算来最小化这种开销。Li 等(2024)使用轻量级特征预测器预测未来位置的倒数第二层隐藏状态,然后使用目标模型的最后一层并行预测相应的令牌作为草稿提议。Cai 等(2024)添加了额外的语言建模头,从相同的隐藏状态解码未来位置。这些方法显著减少了草稿生成的开销,但仍然需要针对目标模型的训练和架构修改。  

#### 自投机解码  
另一类工作完全消除了草稿模型,仅使用目标模型的参数和激活来提议令牌。自投机解码通常依赖于目标模型的有损近似来生成草稿提议——通过提前退出(early exiting)、稀疏性或量化——并重新运行完整推理进行验证。Elhoushi 等(2024)和 Liu 等(2024)通过提前退出实现自投机解码,前者训练中间层为全模型验证草稿令牌,后者添加了基于汤普森采样(Thompson-sampling)的控制器来决定何时退出和投机。虽然这些跳层方法通常需要训练,但基于量化和稀疏性的方法可以完全无需训练。Tiwari 等(2025)使用分层量化的 KV 缓存创建更廉价的自投机草稿传递,同时保留全精度缓存用于验证。Yue 等(2026)协同设计稀疏注意力与自投机解码,使得草稿传递在完全验证之前仅读取 KV 缓存的子集。Zhao 等(2025)也使用稀疏注意力,提出了 PillarAttn,它使用注意力分数动态识别长推理工作流中重要令牌的子集。这些方法都没有直接利用推理模型的结构:即使是针对长 CoT 生成的 PillarAttn,也是将思维链视为需要稀疏注意的序列,而不是利用推理如何收敛到最终答案这一特性。  

#### 无模型方法  
自投机解码方法仍然会因为相对较便宜但依然非平凡的草稿传递而产生开销。在光谱的极端,无模型方法可以以可忽略不计的开销提议文本片段。N-gram 投机解码(Saxena, 2023)提议从提示和先前生成令牌中提取固定长度的 n-gram,在词汇重叠度高的领域效果良好。后缀解码及相关工作(Oliaro et al., 2024; Hu et al., 2025)通过构建这些文本上的后缀树对此进行了扩展,使得能够基于当前生成令牌的已匹配后缀提议更长的片段。这些方法速度快但本质上被动——它们只能重复文本中已存在的内容,无法有意义地适应模型当前的推理状态。  

### 2.2 推理时计算与预算化推理  
近期工作表明,推理语言模型在推理时计算与答案质量之间存在明确的权衡,推动了在测试时显式控制推理长度的方法。预算强制(Budget forcing)通过强制提前终止或扩展推理(例如附加延续令牌)来控制思考令牌的数量,随着推理预算的增加,答案质量通常会提高(Muennighoff et al., 2025)。

相似文章

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。