源自边际分布的树结构:使用因子化先验的自回归草稿生成
摘要
本文介绍了Weaver,一种轻量级的自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树,相对于自回归解码实现了4.37倍的加速,并且比DFlash基线高出24.7%。
arXiv:2607.06763v1 公告类型:新
摘要:推测解码通过用计算换取在单次前向传播中生成额外的token,极大地提高了自回归语言模型的交互性。因子化草稿模型特别高效,因为它们并行预测未来token的边际分布,但其独立性假设导致随着推测预算的增加,接受率急剧下降。我们分析了这一局限性,并介绍了Weaver,一种轻量级的自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树。Weaver恢复了提议token之间的条件依赖性,同时避免了全词汇投影。为了支持具有Gated Delta Net层的模型的快速验证,我们推导出一种无回滚的树验证算法,并在SGLang中实现了优化的CUDA内核。通过结合这些模型和系统方面的贡献,我们实现了相对于自回归解码4.37倍的加速,并且比高度优化的DFlash基线高出24.7%。
查看缓存全文
缓存时间: 2026/07/09 07:43
# 来自边际分布的树:基于因子化先验的自回归草稿生成 来源:https://arxiv.org/abs/2607.06763 查看 PDF (https://arxiv.org/pdf/2607.06763) > 摘要:推测解码通过以计算换效率,在一次前向传播中生成额外token,极大地提升了自回归语言模型的交互性。因子化草稿模型因能并行预测未来token的边际分布而尤为高效,但其独立性假设导致接受率随推测预算增长急剧下降。我们分析了这一局限性,并引入了Weaver——一种轻量级自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树。Weaver在恢复提议token间条件依赖关系的同时,避免了全词汇投影。为支持具有Gated Delta Net层的模型高效验证,我们推导了一种无回滚的树验证算法,并在SGLang中实现了优化的CUDA内核。通过结合模型与系统层面的贡献,我们实现了相比自回归解码4.37倍的加速,且优于高度优化的DFlash基线24.7%。 ## 提交历史 来自:Roman Knyazhitskiy \[查看邮箱 (https://arxiv.org/show-email/ece9bcdf/2607.06763)\] **\[v1\]**2026年7月7日 星期二 19:48:36 UTC (956 KB)
相似文章
GRAFT:基于目标蒸馏边评分的自适应 DLM 草稿树构建
GRAFT 引入了一个用于基于扩散语言模型的推测解码的草稿树构建框架,通过优化边选择和预算分配,实现了相对于自回归解码 2.13 倍至 6.36 倍的加速,同时开销很低。
通过渐进式树形草稿的推测解码解锁自回归语言模型中的并行性
提出渐进式树形草稿(PTD),一种免训练、模型无关的推测解码方法,利用渐进式树结构和逐步剪枝实现多个草稿路径的并行生成,在各种基准测试上实现高达2倍的加速。
PRESTO: 前缀对齐的树状草稿生成用于扩散推测解码
PRESTO 提出了一种用于扩散推测解码的前缀对齐树状草稿生成框架,在专用扩散草稿模型上实现了高达 1.5 倍的加速,在自推测扩散大语言模型上实现了 1.12 倍的加速。
DominoTree:基于Domino的条件树结构草稿用于投机解码
DominoTree引入了一种无训练的最佳优先草稿树用于投机解码,利用Domino的条件(非分解)修正,在Qwen3模型上实现了高达6.6倍的自回归解码加速,并且在所有评估方法中取得了最高的平均接受长度。
减少草稿,增加检索:用于推测解码的混合树构建
Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。