为什么推测解码在2026年走向成熟?
摘要
讨论了为什么推测解码在2026年对LLM推理而言走向成熟,引用了Uber的早期使用、Apple和DeepMind的论文以及Tri Dao的研究,并观察了其在框架和本地部署中的采用情况。
Spec-dec 出现已经有一段时间了,事实上,它并不是为 LLM 推理而生的想法。例如,Uber 的 https://github.com/uber/submitqueue 就把它应用到了合并队列中。Apple 和 GDM 从 2022 年就已经开始发布相关论文。看到它成熟到足以让主流框架采用,并且亲眼目睹它的实际效果,真的令人瞠目结舌。我在这儿跑着 Kimi-K2.5,感觉就像在跑一个小模型一样。最近我看了一个有 Baseten 成员参与的播客,他们明显表示非常看好 spec-dec,还谈到一些客户的定制部署在 spec-dec 上遇到了问题,因为他们自己的自定义工具调用基本上抹杀了草稿模型带来的收益。我在想,如果推测解码用于 LLM 推理是多年前就已经在探索的想法,那为什么我们会在 2026 年才看到它成熟呢?Tri Dao 等人的论文(Speculative Speculative Decoding [1])是促成这一结果的突破吗?它有什么重大缺点吗?你们日常会使用它吗?在我看来,它可能是自 FlashAttn [1] 以来,(本地)LLM 推理最重要的里程碑。 https://arxiv.org/abs/2603.03251
相似文章
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
投机解码的经济学
一篇关于混合专家模型和压缩注意力如何改变LLM推理中投机解码成本效益的技术分析,解释了推测令牌何时不再那么免费。
@charles_irl: 这是spec火热夏天
DeepSeek 开源了 DeepSpec,一个用于训练和评估推测解码模型的完整技术栈代码库。
AngelSpec:面向实际场景的高性能推测解码推理
AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。
@DeRonin_: DeepSeek 刚发布了一篇5页论文和免费GitHub仓库,能让任何LLM响应速度提升80%,这项技术叫推测性解码...
DeepSeek 发布了一篇论文以及采用MIT许可证的开源实现(DSpark),通过使用小型“猜测”模型和大型“检查”模型,将LLM响应速度提升高达80%,同时兼顾速度与准确率,无需权衡取舍。