@charles_irl: 如果你对投机解码感兴趣,花点时间钻研这张图表!并阅读 @haoailab.ht 的文章…
摘要
来自 LLM工程师年鉴 的屋顶线模型估计了在不同模型和硬件上,不同草稿长度下投机解码的加速效果,并附注指出,当开销显著时,该模型可能低估收益。
查看缓存全文
缓存时间: 2026/07/07 01:21
如果您对推测解码感兴趣,请花些时间理解这张图表!并阅读来自 @haoailab 的文章。https://modal.com/llm-almanac/spec-dec-roofline…
LLM 工程师年鉴 - 推测解码屋顶线模型(加速比)
来源:https://modal.com/llm-almanac/spec-dec-roofline
LLM 工程师年鉴 (https://modal.com/llm-almanac/advisor)
γ*=16(最大值),1.6 倍加速
序列长度 4,096 个 token/序列
512 2k 8k 32k 131k
接受概率 75%
每 token 相对成本 10%
接受概率 89%
每块相对成本 10%
该建模系统使用屋顶线分析 (https://modal.com/gpu-glossary/perf/roofline-model) 来估算对于不同硬件上运行的不同模型,采用不同草稿长度进行推测解码所能获得的加速比。这仅仅是一个模型!当开销 (https://modal.com/gpu-glossary/perf/roofline-model) 是延迟的主要贡献因素时(例如小批量大小下的小模型),它往往会低估收益。
此处使用的屋顶线模型受 Fergus Finn (https://github.com/fergusfinn) 和 Doubleword (https://doubleword.ai/) 工作的启发。具体实现参考了他的 DeepSeek-V4 Flash B200 最优草稿长度估计器 (https://fergusfinn.com/blog/economics-of-speculative-decoding/)。
相似文章
@charles_irl: 推测就是一切
Yong Quan 强调,更好的推测解码器可以在 LLM 推理中实现近乎线性的吞吐量提升,该观点由 Charles 在 Modal 研讨会上提出。
@charles_irl: 周五,我们发布了六个用于加速推理的最新先进草稿模型。我们还发布了一篇关于为何……的博文
周五,我们发布了六个用于加速推理的最新先进草稿模型,同时发布了一篇关于推测解码的博文,以及一个用于估算加速比的山脊线模型工具。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。
[研究] JetSpec:通过并行树草案实现推测解码,最高可达9.64倍无损LLM推理加速,超过1000TPS
JetSpec引入了并行树草案技术用于推测解码,在保持无损准确性的同时,实现了LLM推理高达9.64倍的端到端加速,单块B200 GPU上吞吐量达到约1000 TPS。