源自边际分布的树结构:使用因子化先验的自回归草稿生成

arXiv cs.LG 论文

摘要

本文介绍了Weaver,一种轻量级的自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树,相对于自回归解码实现了4.37倍的加速,并且比DFlash基线高出24.7%。

arXiv:2607.06763v1 公告类型:新 摘要:推测解码通过用计算换取在单次前向传播中生成额外的token,极大地提高了自回归语言模型的交互性。因子化草稿模型特别高效,因为它们并行预测未来token的边际分布,但其独立性假设导致随着推测预算的增加,接受率急剧下降。我们分析了这一局限性,并介绍了Weaver,一种轻量级的自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树。Weaver恢复了提议token之间的条件依赖性,同时避免了全词汇投影。为了支持具有Gated Delta Net层的模型的快速验证,我们推导出一种无回滚的树验证算法,并在SGLang中实现了优化的CUDA内核。通过结合这些模型和系统方面的贡献,我们实现了相对于自回归解码4.37倍的加速,并且比高度优化的DFlash基线高出24.7%。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:43

# 来自边际分布的树:基于因子化先验的自回归草稿生成
来源:https://arxiv.org/abs/2607.06763
查看 PDF (https://arxiv.org/pdf/2607.06763)

> 摘要:推测解码通过以计算换效率,在一次前向传播中生成额外token,极大地提升了自回归语言模型的交互性。因子化草稿模型因能并行预测未来token的边际分布而尤为高效,但其独立性假设导致接受率随推测预算增长急剧下降。我们分析了这一局限性,并引入了Weaver——一种轻量级自回归适配器,它从因子化草稿模型的前K个边际分布中构建提议树。Weaver在恢复提议token间条件依赖关系的同时,避免了全词汇投影。为支持具有Gated Delta Net层的模型高效验证,我们推导了一种无回滚的树验证算法,并在SGLang中实现了优化的CUDA内核。通过结合模型与系统层面的贡献,我们实现了相比自回归解码4.37倍的加速,且优于高度优化的DFlash基线24.7%。

## 提交历史

来自:Roman Knyazhitskiy \[查看邮箱 (https://arxiv.org/show-email/ece9bcdf/2607.06763)\] **\[v1\]**2026年7月7日 星期二 19:48:36 UTC (956 KB)

相似文章

DominoTree:基于Domino的条件树结构草稿用于投机解码

arXiv cs.CL

DominoTree引入了一种无训练的最佳优先草稿树用于投机解码,利用Domino的条件(非分解)修正,在Qwen3模型上实现了高达6.6倍的自回归解码加速,并且在所有评估方法中取得了最高的平均接受长度。

减少草稿,增加检索:用于推测解码的混合树构建

Hugging Face Daily Papers

Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。