JetSpec:通过并行树草稿打破推测解码的扩展极限

Hugging Face Daily Papers 论文

摘要

JetSpec是一个推测解码框架,结合高效的前向草稿与因果条件化,提升LLM推理速度与接受率,在MATH-500上实现最高9.64倍加速,在对话工作负载上实现4.58倍加速。

推测解码(SD)通过草拟多个令牌并并行验证来加速自回归大语言模型(LLM),但面临扩展限制:增加草稿预算仅在接受率保持较高且草稿开销较低时才能提升速度。由于基于前序头部(head-based)的SD方法面临因果性与效率的两难困境,这一极限一直难以突破。自回归草稿器生成路径条件候选,适用于树结构推测解码且接受长度更长,但其草稿成本随树深度增长。双向块扩散草稿器一次性生成所有位置,但其分支无关的边缘分布可能形成各自合理但相互矛盾的树,浪费预算并降低接受率。我们提出JetSpec,一种基于头部的SD框架,结合一次前向草稿的效率与分支级因果条件化。JetSpec在冻结目标模型的融合隐藏状态上训练一个因果并行草稿头,生成候选树,其分数与目标模型的自回归分解对齐。这使得JetSpec能够将更大的草稿预算转化为更长的接受前缀和更高的端到端加速。在密集和MoE Qwen3模型上的数学、编码和聊天基准测试中,JetSpec始终优于双向头部和基于树的SD基线。在H100 GPU上,JetSpec在MATH-500上实现最高9.64倍加速,在开放式对话工作负载上实现4.58倍加速,并通过vLLM集成在真实服务负载下展示进一步的延迟降低。我们的代码和模型可在https://github.com/hao-ai-lab/JetSpec获取。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - JetSpec:基于并行树草案突破推测解码的缩放瓶颈

来源:https://huggingface.co/papers/2606.18394
作者:
,
,
,
,
,
,
,
,
,
,

摘要

JetSpec 是一种推测解码框架,它结合了高效前向草案生成与因果条件约束,以在多种基准上提升大语言模型的推理速度和接受率。

推测解码(https://huggingface.co/papers?q=Speculative%20decoding)(SD)通过草拟多个令牌并并行验证,加速了自回归大语言模型(https://huggingface.co/papers?q=autoregressive%20Large%20Language%20Models)(LLM),但它面临一个扩展限制:增加草拟预算(https://huggingface.co/papers?q=draft%20budget)只有在接受率保持较高且草拟开销保持较低时才能提升速度。由于此前基于头的 SD 方法面临因果性-效率困境(https://huggingface.co/papers?q=causality-efficiency%20dilemma),这一瓶颈一直难以突破。自回归草拟器生成路径条件化候选,对树形推测解码(https://huggingface.co/papers?q=tree%20speculative%20decoding)有效,接受长度更高,但其草拟成本随树深度增长。双向块扩散(https://huggingface.co/papers?q=Bidirectional%20block-diffusion)草拟器一次生成所有位置,但其分支无关边际分布(https://huggingface.co/papers?q=branch-agnostic%20marginals)可能产生单独合理但彼此不一致的树,浪费预算并降低接受率。我们提出 JetSpec,一种基于头的 SD 框架,将单次前向草拟效率与分支级因果条件约束相结合。JetSpec 在冻结目标模型的融合隐藏状态(https://huggingface.co/papers?q=fused%20hidden%20states)上训练因果并行草稿头(https://huggingface.co/papers?q=causal%20parallel%20draft%20head),生成候选树,其评分与目标模型的自回归分解(https://huggingface.co/papers?q=autoregressive%20factorization)一致。这使得 JetSpec 能够将更大的草拟预算(https://huggingface.co/papers?q=draft%20budget)转化为更长的已接受前缀和更高的端到端加速比(https://huggingface.co/papers?q=end-to-end%20speedup)。在数学、编码和聊天基准上,针对密集与 MoE Qwen3(https://huggingface.co/papers?q=MoE%20Qwen3)模型,JetSpec 持续优于双向头和基于树的 SD 基线。在 H100 GPU 上,JetSpec 在 MATH-500 上实现高达 9.64 倍加速,在开放式对话负载上实现 4.58 倍加速,并通过 vLLM 集成(https://huggingface.co/papers?q=vLLM%20integration)在真实服务负载下进一步展现延迟改进。我们的代码和模型可在 https://github.com/hao-ai-lab/JetSpec 获取。

查看 arXiv 页面(https://arxiv.org/abs/2606.18394) | 查看 PDF(https://arxiv.org/pdf/2606.18394) | 项目页面(https://jetspec-project.github.io/jetspec-web/) | GitHub(https://github.com/hao-ai-lab/JetSpec) | 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18394)

在你的 agent 中获取此论文:

hf papers read 2606\.18394

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。

引用该论文的数据集 0

无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。

引用该论文的 Space 0

无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.18394 以将其链接至此页面。

包含该论文的合集 0

无合集包含此论文

请将此论文添加至合集(https://huggingface.co/new-collection)以将其链接至此页面。

相似文章

SpecBlock:具有动态树草拟的块迭代投机解码

arXiv cs.CL

本文介绍了 SpecBlock,这是一种块迭代式投机解码方法,通过将路径依赖与高效的草拟相结合来加速大语言模型的推理。与 EAGLE-3 等现有方法相比,它在保持更低草拟成本的同时展示了更高的加速比。

减少草稿,增加检索:用于推测解码的混合树构建

Hugging Face Daily Papers

Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。