@charles_irl: 如果你对投机解码感兴趣,花点时间钻研这张图表!并阅读 @haoailab.ht 的文章…

X AI KOLs Timeline 工具

摘要

来自 LLM工程师年鉴 的屋顶线模型估计了在不同模型和硬件上,不同草稿长度下投机解码的加速效果,并附注指出,当开销显著时,该模型可能低估收益。

如果你对投机解码感兴趣,花点时间钻研这张图表!并阅读来自 @haoailab.https://modal.com/llm-almanac/spec-dec-roofline… 的文章
查看原文
查看缓存全文

缓存时间: 2026/07/07 01:21

如果您对推测解码感兴趣,请花些时间理解这张图表!并阅读来自 @haoailab 的文章。https://modal.com/llm-almanac/spec-dec-roofline…


LLM 工程师年鉴 - 推测解码屋顶线模型(加速比)

来源:https://modal.com/llm-almanac/spec-dec-roofline
LLM 工程师年鉴 (https://modal.com/llm-almanac/advisor)

γ*=16(最大值),1.6 倍加速

序列长度 4,096 个 token/序列

512   2k   8k   32k   131k

接受概率 75%

每 token 相对成本 10%

接受概率 89%

每块相对成本 10%

该建模系统使用屋顶线分析 (https://modal.com/gpu-glossary/perf/roofline-model) 来估算对于不同硬件上运行的不同模型,采用不同草稿长度进行推测解码所能获得的加速比。这仅仅是一个模型!当开销 (https://modal.com/gpu-glossary/perf/roofline-model) 是延迟的主要贡献因素时(例如小批量大小下的小模型),它往往会低估收益。

此处使用的屋顶线模型受 Fergus Finn (https://github.com/fergusfinn) 和 Doubleword (https://doubleword.ai/) 工作的启发。具体实现参考了他的 DeepSeek-V4 Flash B200 最优草稿长度估计器 (https://fergusfinn.com/blog/economics-of-speculative-decoding/)。

相似文章

@charles_irl: 推测就是一切

X AI KOLs Following

Yong Quan 强调,更好的推测解码器可以在 LLM 推理中实现近乎线性的吞吐量提升,该观点由 Charles 在 Modal 研讨会上提出。

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。