JetSpec:通过并行树草稿打破推测解码的扩展极限
摘要
JetSpec是一个推测解码框架,结合高效的前向草稿与因果条件化,提升LLM推理速度与接受率,在MATH-500上实现最高9.64倍加速,在对话工作负载上实现4.58倍加速。
查看缓存全文
缓存时间: 2026/06/26 06:05
论文页面 - JetSpec:基于并行树草案突破推测解码的缩放瓶颈
来源:https://huggingface.co/papers/2606.18394
作者:
,
,
,
,
,
,
,
,
,
,
摘要
JetSpec 是一种推测解码框架,它结合了高效前向草案生成与因果条件约束,以在多种基准上提升大语言模型的推理速度和接受率。
推测解码(https://huggingface.co/papers?q=Speculative%20decoding)(SD)通过草拟多个令牌并并行验证,加速了自回归大语言模型(https://huggingface.co/papers?q=autoregressive%20Large%20Language%20Models)(LLM),但它面临一个扩展限制:增加草拟预算(https://huggingface.co/papers?q=draft%20budget)只有在接受率保持较高且草拟开销保持较低时才能提升速度。由于此前基于头的 SD 方法面临因果性-效率困境(https://huggingface.co/papers?q=causality-efficiency%20dilemma),这一瓶颈一直难以突破。自回归草拟器生成路径条件化候选,对树形推测解码(https://huggingface.co/papers?q=tree%20speculative%20decoding)有效,接受长度更高,但其草拟成本随树深度增长。双向块扩散(https://huggingface.co/papers?q=Bidirectional%20block-diffusion)草拟器一次生成所有位置,但其分支无关边际分布(https://huggingface.co/papers?q=branch-agnostic%20marginals)可能产生单独合理但彼此不一致的树,浪费预算并降低接受率。我们提出 JetSpec,一种基于头的 SD 框架,将单次前向草拟效率与分支级因果条件约束相结合。JetSpec 在冻结目标模型的融合隐藏状态(https://huggingface.co/papers?q=fused%20hidden%20states)上训练因果并行草稿头(https://huggingface.co/papers?q=causal%20parallel%20draft%20head),生成候选树,其评分与目标模型的自回归分解(https://huggingface.co/papers?q=autoregressive%20factorization)一致。这使得 JetSpec 能够将更大的草拟预算(https://huggingface.co/papers?q=draft%20budget)转化为更长的已接受前缀和更高的端到端加速比(https://huggingface.co/papers?q=end-to-end%20speedup)。在数学、编码和聊天基准上,针对密集与 MoE Qwen3(https://huggingface.co/papers?q=MoE%20Qwen3)模型,JetSpec 持续优于双向头和基于树的 SD 基线。在 H100 GPU 上,JetSpec 在 MATH-500 上实现高达 9.64 倍加速,在开放式对话负载上实现 4.58 倍加速,并通过 vLLM 集成(https://huggingface.co/papers?q=vLLM%20integration)在真实服务负载下进一步展现延迟改进。我们的代码和模型可在 https://github.com/hao-ai-lab/JetSpec 获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.18394) | 查看 PDF(https://arxiv.org/pdf/2606.18394) | 项目页面(https://jetspec-project.github.io/jetspec-web/) | GitHub(https://github.com/hao-ai-lab/JetSpec) | 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18394)
在你的 agent 中获取此论文:
hf papers read 2606\.18394
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。
引用该论文的数据集 0
无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。
引用该论文的 Space 0
无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。
包含该论文的合集 0
无合集包含此论文
请将此论文添加至合集(https://huggingface.co/new-collection)以将其链接至此页面。
相似文章
[研究] JetSpec:通过并行树草案实现推测解码,最高可达9.64倍无损LLM推理加速,超过1000TPS
JetSpec引入了并行树草案技术用于推测解码,在保持无损准确性的同时,实现了LLM推理高达9.64倍的端到端加速,单块B200 GPU上吞吐量达到约1000 TPS。
JetFlow:通过并行树草稿打破推测解码的缩放天花板
JetFlow是一个推测解码框架,通过结合单次前向草稿效率与分支级因果条件,打破了缩放天花板,在数学基准上实现了高达9.64倍的加速,并在密集型和MoE Qwen3模型上优于先前方法。
SpecBlock:具有动态树草拟的块迭代投机解码
本文介绍了 SpecBlock,这是一种块迭代式投机解码方法,通过将路径依赖与高效的草拟相结合来加速大语言模型的推理。与 EAGLE-3 等现有方法相比,它在保持更低草拟成本的同时展示了更高的加速比。
通过渐进式树形草稿的推测解码解锁自回归语言模型中的并行性
提出渐进式树形草稿(PTD),一种免训练、模型无关的推测解码方法,利用渐进式树结构和逐步剪枝实现多个草稿路径的并行生成,在各种基准测试上实现高达2倍的加速。
减少草稿,增加检索:用于推测解码的混合树构建
Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。