@mingyilu123: SGLang 现支持 DSpark,这是我见过的对推测解码最实用的改进之一
摘要
SGLang 现已集成 DSpark,这是一种置信驱动的推测解码方法,仅验证高置信度的草稿令牌,从而提升高负载下的推理效率。
SGLang 现支持 DSpark,这是我见过的对推测解码最实用的改进之一👍
查看缓存全文
缓存时间: 2026/07/06 22:22
SGLang 现在支持 DSpark,这是我见过的投机解码中比较实用的改进之一👍
LMSYS Org (@lmsysorg): SGLang 现在支持 DSpark,实现了基于置信度的可变长度验证,用于投机解码 🎉
DSpark 解决了负载下的关键瓶颈:不再验证每个推测令牌,而是只验证推测模型置信度高的部分,因此即使在高负载下也能保持性能提升。
相似文章
@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…
关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。
spec: 添加DSpark推测解码 by wjinxu · 拉取请求 #25173 · ggml-org/llama.cpp
通过拉取请求向llama.cpp添加DSpark推测解码支持,提升推理性能。
@ziv_ravid: https://x.com/ziv_ravid/status/2076074598618083627
解释了 DSpark 论文对推测解码的改进,以加速 LLM 推理,重点在于长草稿生成和自适应验证。
DSpark:基于置信度调度的半自回归推测解码
DSpark 是一个推测解码框架,结合了半自回归草稿生成与置信度调度验证,以加速大语言模型推理,并在高并发场景下提升吞吐量。
@dzhulgakov:来自 @deepseek_ai 的 DSpark 巧妙融合了多种投机解码思路,将吞吐量提升 1.5 到 5 倍…
来自 DeepSeek AI 的 DSpark 集成了投机解码思路,在生产系统中实现 1.5 到 5 倍的吞吐量提升。本推文从基础开始讲解了 10 个关键思路。