[研究] JetSpec:通过并行树草案实现推测解码,最高可达9.64倍无损LLM推理加速,超过1000TPS
摘要
JetSpec引入了并行树草案技术用于推测解码,在保持无损准确性的同时,实现了LLM推理高达9.64倍的端到端加速,单块B200 GPU上吞吐量达到约1000 TPS。
我们发现,通过因果并行树草案技术联合优化草案成本和草案质量,推测解码可以将LLM生成延迟推至极致。JetSpec在MATH-500上实现了高达9.64倍的端到端加速,在开放式对话上实现了4.58倍加速,且保持无损。借助CUDA图和内核优化,JetSpec单块B200 GPU上进一步实现了约1000 TPS的吞吐量。⚡️ 先前的推测解码面临两难:自回归风格的草案头为质量保留了因果性,但草案成本随树深度增长;块扩散风格的草案头单次便宜地生成,但分支通常独立评分,导致深层路径可能相互不一致。JetSpec通过单次生成一个保持因果性的树实现了如此速度。🚀🌳 查看我们的项目页面,了解更多演示和构建方法 👇 https://jetspec-project.github.io/jetspec-web/ 💻 代码:https://github.com/hao-ai-lab/JetSpec 🌟 博客:https://haoailab.com/blogs/parallel-tree-decoding/ JetSpec与DFlash和自回归基线对比。JetSpec配合推理引擎平均渲染约1000 TPS。端到端加速比较。
相似文章
JetSpec:通过并行树草稿打破推测解码的扩展极限
JetSpec是一个推测解码框架,结合高效的前向草稿与因果条件化,提升LLM推理速度与接受率,在MATH-500上实现最高9.64倍加速,在对话工作负载上实现4.58倍加速。
JetFlow:通过并行树草稿打破推测解码的缩放天花板
JetFlow是一个推测解码框架,通过结合单次前向草稿效率与分支级因果条件,打破了缩放天花板,在数学基准上实现了高达9.64倍的加速,并在密集型和MoE Qwen3模型上优于先前方法。
SlimSpec: 用于加速推测解码的低秩 Draft LM-Head
SlimSpec 为 drafter LM-head 引入了低秩参数化方法,以加速 LLMs 中的推测解码,在保持完整词表支持的同时实现了 4-5 倍加速。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
减少草稿,增加检索:用于推测解码的混合树构建
Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。