什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning 工具

摘要

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

目前正在 [Papers with Code](https://paperswithcode.co/) 上流行的方法是推测性解码(Speculative Decoding)。https://preview.redd.it/dm4nh4t71o7h1.png?width=3082&format=png&auto=webp&s=b6468668667d4bcfb6c9248d3af7fd09f21fe0da 推测性解码是一种推理优化技术,它使用快速、小巧的“草稿”模型快速提出多个未来 token,然后由较大、较慢的“目标”模型并行验证。这通过每个步骤允许输出多个 token,显著加速大型语言模型(LLM)的 token 生成,同时不牺牲输出质量。SGLang,是与 vLLM 并列最流行的 LLM 运行框架之一,刚刚发布了一篇博客文章,详细介绍了他们如何使用 Modal 和 Z.ai 的 DFlash 推测性解码模型来实现 LLM 推理服务的最先进延迟。了解更多请访问 [https://paperswithcode.co/methods/speculative-decoding](https://paperswithcode.co/methods/speculative-decoding)。您还可以找到引用引入该技术的原始论文的所有论文。SGLang 的博客:[https://www.lmsys.org/blog/2026-06-15-next-generation-speculative-decoding-dflash-v2/](https://www.lmsys.org/blog/2026-06-15-next-generation-speculative-decoding-dflash-v2/) 请让我知道还应该添加哪些其他方法!祝好,来自 HF 的 Niels
查看原文

相似文章

基于推测词汇表的推测解码

arXiv cs.CL

本文提出SpecVocab,一种为推测解码中的草稿模型逐步骤选择词汇子集的方法,实现了更高的接受长度,并相较于EAGLE-3最高提升8.1%的吞吐量。

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。

跨语言的推测解码

arXiv cs.CL

本文比较了三种策略以提高非英语语言的推测解码效率,发现任务特定蒸馏能提高接受率但泛化性差,而n-gram草稿模型尽管接受率较低,却能提供持续的加速。

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。