DSpark:基于置信度调度的半自回归推测解码

Hugging Face Daily Papers 论文

摘要

DSpark 是一个推测解码框架,结合了半自回归草稿生成与置信度调度验证,以加速大语言模型推理,并在高并发场景下提升吞吐量。

推测解码通过将草稿生成与目标验证解耦,加速大语言模型(LLM)的推理。虽然最近的并行草稿生成器能在单次前向传播中高效地提出长 token 序列,但由于缺乏 token 间的依赖关系,它们会遭遇接受率快速下降的问题。此外,不加区分地验证这些扩展的块会浪费关键的批量容量在具有高拒绝风险的 token 上,严重降低高并发服务系统的吞吐量。我们提出了 DSpark,一个将高吞吐并行生成与自适应、负载感知验证相统一的推测解码框架。为保持草稿质量,DSpark 采用半自回归架构,将并行主干与轻量级顺序模块相结合,引入块内依赖建模以缓解后缀衰减。为优化系统效率,DSpark 采用置信度调度验证,基于估计的前缀存活概率和引擎特定的吞吐量特征,动态调整每个请求的验证长度。在跨不同领域的离线基准测试中,相比最先进的自回归和并行草稿生成器,DSpark 显著提高了接受长度。当部署在 DeepSeek-V4 服务系统并处理真实用户流量时,DSpark 成功减轻了验证浪费。与既有生产基线(MTP-1)相比,在匹配的吞吐量水平下,DSpark 将每用户的生成速度提升了 60% 到 85%。更重要的是,通过防止在严格交互性约束下出现严重的吞吐量下降,DSpark 实现了先前无法达到的性能层级,从而推动了服务系统的帕累托前沿。
查看原文
查看缓存全文

缓存时间: 2026/07/08 06:48

论文页面 - DSpark:基于置信度调度的推测解码与半自回归生成

来源:https://huggingface.co/papers/2607.05147 作者:

(省略作者列表,按原文保留空白行)

摘要

DSpark 通过将并行草稿生成与自适应验证相结合,减少了浪费并提升了高并发场景下的吞吐量,从而加速 LLM 推理。

推测解码 (https://huggingface.co/papers?q=Speculative%20decoding) 通过将草稿生成与目标验证 (https://huggingface.co/papers?q=verification) 解耦,加速了大语言模型 (LLM) 的推理。尽管近期的并行草稿生成器 (https://huggingface.co/papers?q=parallel%20drafters) 能在单次前向传播中高效地生成长 token 序列,但由于缺乏 token 间依赖性 (https://huggingface.co/papers?q=inter-token%20dependencies),它们会受到快速接受衰减 (https://huggingface.co/papers?q=acceptance%20decay) 的影响。此外,不加区分地验证这些扩展块,会浪费宝贵的批次容量在高拒绝风险的 token 上,严重降低高并发服务系统中的吞吐量 (https://huggingface.co/papers?q=throughput)。我们提出 DSpark,这是一个推测解码 (https://huggingface.co/papers?q=speculative%20decoding) 框架,它统一了高吞吐量 (https://huggingface.co/papers?q=throughput) 并行生成与自适应、负载感知的验证 (https://huggingface.co/papers?q=verification)。为了保持草稿质量,DSpark 利用半自回归架构 (https://huggingface.co/papers?q=semi-autoregressive%20architecture),将并行骨干网络与轻量级顺序模块相结合,引入块内依赖建模并缓解后缀衰减。为了优化系统效率,DSpark 采用置信度调度验证 (https://huggingface.co/papers?q=confidence-scheduled%20verification),根据估计的前缀生存概率 (https://huggingface.co/papers?q=prefix%20survival%20probabilities) 和引擎特定的吞吐量 (https://huggingface.co/papers?q=throughput) 配置文件,动态调整每个请求的验证 (https://huggingface.co/papers?q=verification) 长度。在跨多个领域的离线基准测试中,DSpark 相较于最先进的自回归和并行草稿生成器 (https://huggingface.co/papers?q=parallel%20drafters),显著提升了接受长度。当部署在 DeepSeek-V4 服务系统中并处理实时用户流量时,DSpark 成功减少了验证 (https://huggingface.co/papers?q=verification) 浪费。与已投入生产的基线 (MTP-1) 相比,在匹配的吞吐量 (https://huggingface.co/papers?q=throughput) 水平下,DSpark 将单用户生成速度提升了 60% 到 85%。更重要的是,通过在严格的交互性约束下防止严重的吞吐量 (https://huggingface.co/papers?q=throughput) 退化,它实现了以前无法达到的性能层级,从而改变了我们服务系统的帕累托前沿 (https://huggingface.co/papers?q=Pareto%20frontier)。

查看 arXiv 页面 (https://arxiv.org/abs/2607.05147) 查看 PDF (https://arxiv.org/pdf/2607.05147) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05147)

在您的 agent 中获取此论文:

hf papers read 2607\.05147

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.05147 以从本页链接。

包含此论文的收藏集0

没有收藏集包含此论文

添加此论文到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。