parallel-drafting

标签

Cards List
#parallel-drafting

并行生成草稿,通过深度进行条件化:用于推测解码的相邻因果注入

arXiv cs.LG ↗ · 16小时前 缓存

提出DSpine,一种通过网络深度注入相邻因果条件的并行推测解码drafter,在SGLang中实现高效并行执行,较DFlash在Qwen3-8B上平均接受长度提升27.8%、吞吐量提升23.3%。

0 人收藏 0 人点赞
#parallel-drafting

DFlash 2:保持并行起草

Reddit r/LocalLLaMA ↗ · 2026-08-18 缓存

DFlash 2 通过并行预测令牌改进推测解码,在最小延迟下实现每次验证通过时输出增加超过20%,并集成到主要推理引擎如 SGLang 和 vLLM 中。

0 人收藏 0 人点赞
#parallel-drafting

通过渐进式树形草稿的推测解码解锁自回归语言模型中的并行性

arXiv cs.CL ↗ · 2026-07-14 缓存

提出渐进式树形草稿(PTD),一种免训练、模型无关的推测解码方法,利用渐进式树结构和逐步剪枝实现多个草稿路径的并行生成,在各种基准测试上实现高达2倍的加速。

0 人收藏 0 人点赞
#parallel-drafting

JetSpec:通过并行树草稿打破推测解码的扩展极限

Hugging Face Daily Papers ↗ · 2026-06-25 缓存

JetSpec是一个推测解码框架,结合高效的前向草稿与因果条件化,提升LLM推理速度与接受率,在MATH-500上实现最高9.64倍加速,在对话工作负载上实现4.58倍加速。

0 人收藏 0 人点赞
#parallel-drafting

Domino:在推测解码中将因果建模与自回归草稿生成解耦

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

Domino是一个推测解码框架,它将因果依赖建模与自回归草稿生成解耦,采用并行主干和轻量级因果精炼头,在Qwen3模型上实现了高达5.49倍的端到端加速。

0 人收藏 0 人点赞
#parallel-drafting

D-PACE: 面向并行推测草稿的动态位置感知交叉熵

arXiv cs.LG ↗ · 2026-05-20 缓存

本文介绍了D-PACE,一种用于训练推测解码草稿模型的动态位置感知交叉熵损失,该损失函数自适应地加权位置以提升接受长度和推理速度,在各基准测试中实现一致的加速比,且开销极低。

0 人收藏 0 人点赞
#parallel-drafting

PARD-2:面向双模态投机解码的目标对齐并行草稿模型

arXiv cs.CL ↗ · 2026-05-12 缓存

本文介绍了 PARD-2,这是一种双模态投机解码框架,利用目标对齐的并行草稿模型加速大语言模型(LLM)推理,在 Llama 3.1-8B 上实现了最高 6.94 倍的无损加速。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈