draft-model

标签

Cards List
#draft-model

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 2天前 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#draft-model

这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA ↗ · 2026-09-12

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

0 人收藏 0 人点赞
#draft-model

incoai/Qwen3.8-27B-DFlash2

Hugging Face Models Trending ↗ · 2026-08-18 缓存

DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。

0 人收藏 0 人点赞
#draft-model

z-lab/Qwen3.8-27B-DFlash2

Hugging Face Models Trending ↗ · 2026-08-15 缓存

介绍了 DFlash 2,一种用于与 Qwen3.8-27B 模型进行投机解码的块扩散草稿器,在基准测试中展示了改进的接受长度和吞吐量。

0 人收藏 0 人点赞
#draft-model

DeepSeek 开源推理优化,生成速度提升 60–85% [pdf]

Hacker News Top ↗ · 2026-06-27 缓存

DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。

0 人收藏 0 人点赞
#draft-model

MiniMax-M3-EAGLE3-GGUF - 兼容 Llama.cpp 的 MiniMax M3 EAGLE 草稿模型!

Reddit r/LocalLLaMA ↗ · 2026-06-23

现在有了适用于 llama.cpp 的 MiniMax M3 EAGLE 草稿模型的 GGUF 转换,可在兼容硬件上实现推测解码加速。

0 人收藏 0 人点赞
#draft-model

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning ↗ · 2026-06-17

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

0 人收藏 0 人点赞
#draft-model

@Ex0byt: 浅谈specdec的多种风格,以及我为何尝试为各位制作Qwen-3.6-27b EAGLE-3草稿模型

X AI KOLs Timeline ↗ · 2026-05-17 缓存

讨论了推测解码的多种风格,并尝试为社区制作一个Qwen-3.6-27b EAGLE-3草稿模型。

0 人收藏 0 人点赞
#draft-model

性能驱动的推测解码自适应窗口化策略优化

arXiv cs.CL ↗ · 2026-05-15 缓存

提出PPOW,一种强化学习框架,用于优化推测解码中的草稿模型,采用窗口级目标和自适应窗口化,在多个基准测试中实现了显著加速。

0 人收藏 0 人点赞
#draft-model

SlimSpec: 用于加速推测解码的低秩 Draft LM-Head

Hugging Face Daily Papers ↗ · 2026-05-11 缓存

SlimSpec 为 drafter LM-head 引入了低秩参数化方法,以加速 LLMs 中的推测解码,在保持完整词表支持的同时实现了 4-5 倍加速。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈