DeLS-Spec: 解耦的长短上下文用于并行推测性草拟
摘要
DeLS-Spec通过在DFlash上添加轻量级局部头,将推测性解码中的长上下文和短上下文建模解耦,无需完全重新训练即可实现一致的加速。它仅需要对局部头进行标准的下一个词元预测训练,并在Qwen3基准测试中提高了接受长度。
arXiv:2607.07409v1 公告类型:新 \n摘要:推测性解码通过草拟多个词元并并行验证,加速了大语言模型推理。块并行草拟器(如DFlash)通过一次性预测整个块进一步提高草拟效率,但其逐位置预测缺乏显式的块内因果条件。最近的方法如Domino和DSpark尝试在块并行草拟中引入这种因果性,但它们需要从头开始训练草拟模型,这限制了灵活性并增加了训练成本。我们提出DeLS-Spec,一种解耦长短上下文的推测性解码方法。DeLS-Spec将固定DFlash模型视为长上下文专家,并引入轻量级局部头作为短上下文专家。局部头可以使用标准的下一个词元预测目标独立训练,无需与目标模型或DFlash骨干网络联合训练,从而训练成本极低。在推理时,DeLS-Spec结合长上下文和短上下文的logits,且局部头不绑定特定DFlash检查点,使方法更加模块化和灵活。在Qwen3模型上的实验表明,DeLS-Spec在数学、代码和对话基准测试上,相对于DFlash一致地提高了加速比和平均接受长度。
查看缓存全文
缓存时间: 2026/07/09 07:50
# DeLS-Spec: 面向并行推测性草稿的解耦长-短上下文方法
来源: https://arxiv.org/html/2607.07409
Hong-Kai Zheng, Piji Li
南京航空航天大学人工智能学院
中国南京
模式分析与机器智能工信部重点实验室,南京
脑机智能技术教育部重点实验室,南京
\{dt\_ttt,pjli\}@nuaa.edu.cn
###### 摘要
推测性解码通过草拟多个 token 并并行验证它们来加速大语言模型推理。诸如 DFlash 之类的块并行草稿器通过一次前向传播预测整个块来进一步提高草稿效率,但它们的位置级预测缺乏显式的块内因果条件。最近的方法如 Domino 和 DSpark 试图将这种因果性引入块并行草稿中,但它们需要从头训练草稿模型,这限制了其灵活性并增加了训练成本。我们提出 **DeLS-Spec**,一种解耦的长-短上下文推测性解码方法。DeLS-Spec 将固定的 DFlash 模型视为长上下文专家,并引入一个轻量级的局部头作为短上下文专家。该局部头可以使用标准的下一 token 预测目标独立训练,无需与目标模型或 DFlash 主干联合训练,从而实现了极低的训练成本。在推理时,DeLS-Spec 结合长上下文和短上下文的 logits,并且局部头不绑定特定的 DFlash 检查点,这使得该方法更加模块化和灵活。在 Qwen3 模型上的实验表明,DeLS-Spec 在数学、编程和对话基准测试中一致地提高了加速比和平均接受长度,性能优于 DFlash。代码可在 GitHub (https://github.com/dt-3t/DeLS-Spec) 上获取。
## 1 引言
大语言模型通常通过自回归方式进行解码 (Achiam et al., 2023 (https://arxiv.org/html/2607.07409#bib.bib34); Liu et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib35); Yang et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib36)),其中每个生成的 token 都需要目标模型进行一次新的前向传播。这一串行过程成为主要的延迟瓶颈,尤其是在长文本生成和交互式应用中。推测性解码通过使用轻量级的草稿模型提出多个未来 token,然后由目标模型并行验证这些 token(同时保持目标分布)来缓解此问题 (Leviathan et al., 2023 (https://arxiv.org/html/2607.07409#bib.bib2); Chen et al., 2023 (https://arxiv.org/html/2607.07409#bib.bib3))。
推测性解码的效率在很大程度上取决于草稿器 (Cai et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib6); Ankner et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib7); Li et al., 2024b (https://arxiv.org/html/2607.07409#bib.bib8);a (https://arxiv.org/html/2607.07409#bib.bib9);2026b (https://arxiv.org/html/2607.07409#bib.bib10))。传统的自回归草稿器保持了较强的局部一致性,但仍然顺序生成草稿 token (Li et al., 2024b (https://arxiv.org/html/2607.07409#bib.bib8); Cheng et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib11))。最近的块并行草稿器,如 DFlash,通过一次前向传播预测一整块 token 来提高草稿效率 (An et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib23); Liu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib24); Chen et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib25))。然而,这种并行性也带来一个限制:同一草稿块中的 token 在很大程度上是独立预测的,没有显式地以该块中之前草拟的 token 为条件 (Chen et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib25); Huang et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib28); Rheinboldt et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib30))。结果,DFlash 从前缀提供了很强的长上下文预测,但缺乏草稿块内部的显式短上下文因果建模。
最近的一些方法,包括 Domino 和 DSpark,试图通过将块内因果性引入块并行草稿来解决这个问题 (Huang et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib28); Cheng et al., 2026b (https://arxiv.org/html/2607.07409#bib.bib1); Hu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib29); Rheinboldt et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib30))。这些方法表明,对草稿块内部的因果依赖关系进行建模可以提高接受率。然而,它们通常需要从头训练一个新的草稿模型,或者联合训练草稿主干和额外的因果组件。这使得当已经训练好一个 DFlash 风格的草稿器时,应用这些方法的成本很高,并且限制了它们在不同草稿检查点之间的灵活性。
在这项工作中,我们提出 **DeLS-Spec**,一种解耦的长-短上下文推测性解码方法。DeLS-Spec 不是修改或重新训练 DFlash 主干 (Chen et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib25)),而是保持 DFlash 固定不变,作为长上下文专家,并引入一个轻量级的局部头作为短上下文专家。DFlash 专家从完整前缀中捕获语义和任务级信息,而局部头则从当前块内已经草拟的 token 中捕获因果依赖关系。
DeLS-Spec 的一个关键特性是其解耦训练。局部头在纯文本数据上使用标准的下一 token 预测目标独立训练。它不需要目标模型的隐藏状态、DFlash 隐藏状态,也不需要与推测性解码流水线进行联合优化。这使得训练成本极低,并且允许将局部头附加到已经训练好的现有 DFlash 风格检查点上。在推理时,DeLS-Spec 结合了来自 DFlash 的长上下文 logits 和来自局部头的短上下文 logits (Hinton, 2002 (https://arxiv.org/html/2607.07409#bib.bib33))。由于局部头不是与特定的 DFlash 检查点一起训练的,因此在推理时它不与 DFlash 权重一一绑定。这使得该方法更具模块化和灵活性:一个训练好的局部头可以跨兼容的 DFlash 检查点重用或转移,而不需要为每种设置训练新的草稿模型。
我们在 Qwen3 模型 (Yang et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib36)) 上评估了 DeLS-Spec,涉及数学、编程和对话基准测试。实验表明,与 DFlash 相比,DeLS-Spec 一致地提高了解码速度和平均接受长度。这些结果表明,将长上下文块并行草稿与短上下文因果校正解耦,是增强现有推测性解码系统的一种高效且实用的方法。
我们的贡献总结如下:
- • 我们提出了 DeLS-Spec,一种解耦的长-短上下文推测性解码方法,它在不重新训练 DFlash 主干的情况下改进了 DFlash 风格的块并行草稿。
- • 我们引入了一个轻量级的局部头,提供块内因果信息,并且可以使用标准的下一 token 预测目标独立训练。
- • 在数学、编程和对话基准测试中,DeLS-Spec 在 Qwen3 模型上一致地增强了 DFlash,同时在不同检查点之间提供了模块化灵活性。
## 2 相关工作
#### 推测性解码与经典草稿器。
推测性解码通过使用轻量级草稿器提出多个 token,并由目标模型并行验证这些 token(同时保持目标分布)来加速自回归推理 (Leviathan et al., 2023 (https://arxiv.org/html/2607.07409#bib.bib2); Chen et al., 2023 (https://arxiv.org/html/2607.07409#bib.bib3))。早期的块解码和基于树的验证减少了顺序解码轮次或扩大了候选覆盖范围 (Stern et al., 2018 (https://arxiv.org/html/2607.07409#bib.bib4); Miao et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib5))。后来的草稿器通过目标附加头、顺序依赖头、特征级草稿、动态草稿树、循环草稿和知识蒸馏来提高提议质量 (Cai et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib6); Ankner et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib7); Li et al., 2024b (https://arxiv.org/html/2607.07409#bib.bib8);a (https://arxiv.org/html/2607.07409#bib.bib9);2026b (https://arxiv.org/html/2607.07409#bib.bib10); Cheng et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib11); Zhou et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib12))。然而,许多草稿器仍然需要顺序草稿、特征更新或树结构构建,使得草稿成本随推测预算增长。
#### 并行与扩散式草稿。
并行生成通过同时预测多个位置来减少草稿延迟,但也削弱了 token 之间的依赖关系,这在非自回归和扩散式语言生成中已经观察到 (Gu et al., 2017 (https://arxiv.org/html/2607.07409#bib.bib13); Nie et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib14); Arriola et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib15); Cheng et al., 2026a (https://arxiv.org/html/2607.07409#bib.bib17); Liu et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib18))。因此,最近的推测性草稿器使用扩散或并行预测来高效生成草稿块 (Christopher et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib20); Li et al., 2026a (https://arxiv.org/html/2607.07409#bib.bib21); Sandler et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib22); An et al., 2025 (https://arxiv.org/html/2607.07409#bib.bib23); Liu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib24))。DFlash 与我们的工作最相关:它使用一个轻量级的块扩散草稿器,并注入目标隐藏状态,以获得强大的长上下文条件,并在一次前向传播中生成整个块 (Chen et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib25))。后续方法为这种并行草稿器构建草稿树或改进训练目标 (Ringel and Romano, 2026 (https://arxiv.org/html/2607.07409#bib.bib26); Wu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib27))。尽管如此,DFlash 风格的块并行预测主要建模位置级的长上下文分布,缺乏对局部草稿前缀的显式条件,这可能会损害后续 token 的接受率。
#### 块内因果性与并行草稿器校正。
有几种方法解决了并行草稿中缺失的局部因果性问题。Hydra 在草稿头之间引入了依赖性 (Ankner et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib7)); Domino 使用 GRU 因果编码器和低秩残差头来校正 DFlash 风格的 logits (Huang et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib28)); DSpark 添加了半自回归 Markov/RNN 头和置信度调度 (Cheng et al., 2026b (https://arxiv.org/html/2607.07409#bib.bib1)); JetSpec 使用树因果注意力在分支间进行因果条件建模 (Hu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib29)); TreeFlash 在 DFlash 之上近似局部自回归分布 (Rheinboldt et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib30))。D-PACE 进一步表明接受长度与位置相关的前缀接受度有关 (Wu et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib27))。尽管结构化非自回归解码和基于 CTC 的草稿可以引入依赖性或对齐 (Sun et al., 2019 (https://arxiv.org/html/2607.07409#bib.bib31); Wen et al., 2024 (https://arxiv.org/html/2607.07409#bib.bib32)),但它们与标准无损验证所需的精确每个位置概率兼容性较差。与这些统一的校正流水线不同,DeLS-Spec 将训练好的 DFlash 草稿器固定为长上下文专家,独立训练一个轻量级的短上下文专家用于块内因果性,并使用 unigram 先验校正来融合它们的 logits,以避免对频率偏差造成重复计数。
## 3 预备知识
### 3.1 并行草稿模型: DFlash
设 $y = x_{<k}$ 为观察到的长上下文,并设 $x_k, x_{k+1}, \ldots, x_{k+s}$ 为待草拟的未来 token 块。并行草稿模型如 DFlash (Chen et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib25)) 通过单次前向传播预测多个未来 token 来执行块并行草稿。具体来说,对于草稿块内的每个位置,模型预测:
$$ p_L(x_i \mid y), \quad i \in \{k, \ldots, k+s\}. \tag{1} $$
尽管 DFlash 被描述为一个扩散语言模型,但其实际草稿过程由一次前向传播和一次采样步骤组成,这可以视为具有单步去噪的扩散语言模型。与自回归草稿模型相比,这种设计显著降低了草稿延迟。然而,由于块内的 token 是并行预测的,每个位置不知道其他位置生成的 token。因此,草稿块内部的因果依赖关系较弱,这限制了推测性解码过程中的接受长度。
### 3.2 引入块内因果性
最近的方法如 Domino (Huang et al., 2026 (https://arxiv.org/html/2607.07409#bib.bib28)) 和 DSpark (Cheng et al., 2026b (https://arxiv.org/html/2607.07409#bib.bib1)) 通过在并行的 DFlash 主干之上引入块内因果建模来解决这个问题。它们在并行主干之后附加一个轻量级的因果校正头,并直接优化:
$$ \mathcal{L}_{\mathrm{cc}} = -\sum_{i=k+1}^{k+s} \log p(x_i \mid y, z_i), \quad z_i = x_{k:i-1}. \tag{2} $$
其中 $z_i$ 表示草稿块内的局部前缀。尽管这种因果校正改善了局部一致性,但它通常作为完整草稿流水线的一部分进行训练。特别地,它依赖于目标模型,并且需要对并行的 DFlash 主干和因果校正头进行联合训练或微调。因此,将这种因果依赖机制迁移到已训练的 DFlash 模型可能成本高昂,尤其是当模型规模增大时。
## 4 方法
图 1: DeLS-Spec 概述。DFlash 并行产生长上下文 logits,而轻量级局部头从草稿前缀顺序估计短上下文 logits。DeLS-Spec 使用 unigram 先验融合它们以获得最终的草稿 logits,然后进行采样并由目标模型在标准推测性解码下验证。
### 4.1 解耦的长-短上下文
我们提出 **DeLS-Spec**,一种用于推测性草稿的解耦长-短上下文建模方法。关键观察是,已训练的 DFlash 模型提供了一个长上下文条件分布 $p_L(x_i \mid y)$,该分布捕获了来自完整前缀 $y$ 的语义和任务级约束。所缺少的是由局部块前缀 $z_i$ 引起的短程因果依赖关系。因此,一个自然的出发点是专家乘积 (Hinton, 2002 (https://arxiv.org/html/2607.07409#bib.bib33)) 公式:
$$ p(x_i \mid y, z_i) \approx p(x_i \mid y)\, p(x_i \mid z_i). \tag{3} $$
从这个角度看,长上下文专家提供全局语义约束,而短上下文专家提供草稿块内的局部连贯性约束。然而,这种分解并不是精确的...相似文章
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
SlimSpec: 用于加速推测解码的低秩 Draft LM-Head
SlimSpec 为 drafter LM-head 引入了低秩参数化方法,以加速 LLMs 中的推测解码,在保持完整词表支持的同时实现了 4-5 倍加速。
MicroSpec: 通过轻量级上下文词汇表加速推测解码
MicroSpec 是一种无需训练的技术,它能即时构建紧凑的上下文感知词汇表,以加速大型语言模型中的推测解码,将平均词汇表大小减少40倍以上,并相比EAGLE-2实现了高达1.32倍的端到端加速。
Dustin: 草稿增强的稀疏验证用于高效长上下文生成与推测解码
Dustin提出了一种用于推测解码的稀疏验证框架,利用草稿模型信号和稀疏注意力头评分克服KV缓存验证瓶颈,在长上下文任务中自注意力加速达27.85倍,端到端解码加速达9.17倍,且精度损失可忽略不计。
整体之稀疏一瞥:无需训练的自推测解码
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。