DSpark:基于置信度调度的半自回归推测解码
摘要
DSpark 是一个推测解码框架,结合了半自回归草稿生成与置信度调度验证,以加速大语言模型推理,并在高并发场景下提升吞吐量。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - DSpark:基于置信度调度的推测解码与半自回归生成
来源:https://huggingface.co/papers/2607.05147 作者:
(省略作者列表,按原文保留空白行)
摘要
DSpark 通过将并行草稿生成与自适应验证相结合,减少了浪费并提升了高并发场景下的吞吐量,从而加速 LLM 推理。
推测解码 (https://huggingface.co/papers?q=Speculative%20decoding) 通过将草稿生成与目标验证 (https://huggingface.co/papers?q=verification) 解耦,加速了大语言模型 (LLM) 的推理。尽管近期的并行草稿生成器 (https://huggingface.co/papers?q=parallel%20drafters) 能在单次前向传播中高效地生成长 token 序列,但由于缺乏 token 间依赖性 (https://huggingface.co/papers?q=inter-token%20dependencies),它们会受到快速接受衰减 (https://huggingface.co/papers?q=acceptance%20decay) 的影响。此外,不加区分地验证这些扩展块,会浪费宝贵的批次容量在高拒绝风险的 token 上,严重降低高并发服务系统中的吞吐量 (https://huggingface.co/papers?q=throughput)。我们提出 DSpark,这是一个推测解码 (https://huggingface.co/papers?q=speculative%20decoding) 框架,它统一了高吞吐量 (https://huggingface.co/papers?q=throughput) 并行生成与自适应、负载感知的验证 (https://huggingface.co/papers?q=verification)。为了保持草稿质量,DSpark 利用半自回归架构 (https://huggingface.co/papers?q=semi-autoregressive%20architecture),将并行骨干网络与轻量级顺序模块相结合,引入块内依赖建模并缓解后缀衰减。为了优化系统效率,DSpark 采用置信度调度验证 (https://huggingface.co/papers?q=confidence-scheduled%20verification),根据估计的前缀生存概率 (https://huggingface.co/papers?q=prefix%20survival%20probabilities) 和引擎特定的吞吐量 (https://huggingface.co/papers?q=throughput) 配置文件,动态调整每个请求的验证 (https://huggingface.co/papers?q=verification) 长度。在跨多个领域的离线基准测试中,DSpark 相较于最先进的自回归和并行草稿生成器 (https://huggingface.co/papers?q=parallel%20drafters),显著提升了接受长度。当部署在 DeepSeek-V4 服务系统中并处理实时用户流量时,DSpark 成功减少了验证 (https://huggingface.co/papers?q=verification) 浪费。与已投入生产的基线 (MTP-1) 相比,在匹配的吞吐量 (https://huggingface.co/papers?q=throughput) 水平下,DSpark 将单用户生成速度提升了 60% 到 85%。更重要的是,通过在严格的交互性约束下防止严重的吞吐量 (https://huggingface.co/papers?q=throughput) 退化,它实现了以前无法达到的性能层级,从而改变了我们服务系统的帕累托前沿 (https://huggingface.co/papers?q=Pareto%20frontier)。
查看 arXiv 页面 (https://arxiv.org/abs/2607.05147) 查看 PDF (https://arxiv.org/pdf/2607.05147) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05147)
在您的 agent 中获取此论文:
hf papers read 2607\.05147
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。
包含此论文的收藏集0
没有收藏集包含此论文
添加此论文到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
@ziv_ravid: https://x.com/ziv_ravid/status/2076074598618083627
解释了 DSpark 论文对推测解码的改进,以加速 LLM 推理,重点在于长草稿生成和自适应验证。
@dzhulgakov:来自 @deepseek_ai 的 DSpark 巧妙融合了多种投机解码思路,将吞吐量提升 1.5 到 5 倍…
来自 DeepSeek AI 的 DSpark 集成了投机解码思路,在生产系统中实现 1.5 到 5 倍的吞吐量提升。本推文从基础开始讲解了 10 个关键思路。
@mingyilu123: SGLang 现支持 DSpark,这是我见过的对推测解码最实用的改进之一
SGLang 现已集成 DSpark,这是一种置信驱动的推测解码方法,仅验证高置信度的草稿令牌,从而提升高负载下的推理效率。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
Dustin: 草稿增强的稀疏验证用于高效长上下文生成与推测解码
Dustin提出了一种用于推测解码的稀疏验证框架,利用草稿模型信号和稀疏注意力头评分克服KV缓存验证瓶颈,在长上下文任务中自注意力加速达27.85倍,端到端解码加速达9.17倍,且精度损失可忽略不计。