speculative-decoding

标签

Cards List
#speculative-decoding

SpecLA:面向线性注意力模型的高效推测解码

arXiv cs.CL · 2026-07-21 缓存

SpecLA 提出了一种专为有状态线性注意力模型设计的推测解码运行时,在搭载 GDN-1.3B 目标模型的 NVIDIA H100 上,相比自回归解码实现了最高 1.70 倍的端到端加速。

0 人收藏 0 人点赞
#speculative-decoding

基于推测词汇表的推测解码

arXiv cs.CL · 2026-07-20 缓存

本文提出SpecVocab,一种为推测解码中的草稿模型逐步骤选择词汇子集的方法,实现了更高的接受长度,并相较于EAGLE-3最高提升8.1%的吞吐量。

0 人收藏 0 人点赞
#speculative-decoding

我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。

Reddit r/LocalLLaMA · 2026-07-16

llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。

0 人收藏 0 人点赞
#speculative-decoding

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#speculative-decoding

@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……

X AI KOLs Timeline · 2026-07-15 缓存

MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。

0 人收藏 0 人点赞
#speculative-decoding

更少专家,更快解码:面向混合专家模型的成本感知推测解码

arXiv cs.CL · 2026-07-15 缓存

本文提出EcoSpec,一种针对混合专家模型的成本感知推测解码框架,在草稿选择阶段考虑了专家激活成本。通过在无需修改目标模型验证规则的情况下减少专家足迹,该方法在DeepSeek-V3.1、Qwen3-235B-A22B和GPT-OSS-120B等大规模MoE模型上实现了高达1.62倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

被接受的前缀并非万能:关于基于PEFT的Block-Diffusion Drafting的负面结果

arXiv cs.AI · 2026-07-15 缓存

本文研究了PEFT-BD,这是一种推测解码方法,使用类似LoRA的适配器作为块扩散起草器,并发现尽管接受的前缀数量可观,但由于起草器仍需进行完整的骨干前向计算,因此并未加速,即计算效率不高。

0 人收藏 0 人点赞
#speculative-decoding

@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following · 2026-07-14 缓存

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

0 人收藏 0 人点赞
#speculative-decoding

@rohanpaul_ai: 空间推测解码(SSD)通过并行预测图像行,将自回归图像模型的速度提升高达13.28倍

X AI KOLs Timeline · 2026-07-14 缓存

空间推测解码(SSD)通过使用小型辅助网络并行预测整行像素,加速了自回归图像模型,实现了高达13.28倍的加速,同时保持了基准性能。

0 人收藏 0 人点赞
#speculative-decoding

通过渐进式树形草稿的推测解码解锁自回归语言模型中的并行性

arXiv cs.CL · 2026-07-14 缓存

提出渐进式树形草稿(PTD),一种免训练、模型无关的推测解码方法,利用渐进式树结构和逐步剪枝实现多个草稿路径的并行生成,在各种基准测试上实现高达2倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

模型:由 satindergrewal 添加 Hy3 (hy_v3) 支持及 MTP 推测解码 · 拉取请求 #25395 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-07-14 缓存

此拉取请求为 llama.cpp 添加了对 Hy3 (hy_v3) 模型的支持及 MTP 推测解码,从而实现了该架构的高效推理。

0 人收藏 0 人点赞
#speculative-decoding

AngelSlim/Hy3-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

AngelSlim/Hy3-GGUF 是一个用于在 llama.cpp 上量化和部署 Hy3 大语言模型的工具包,具有 MTP 自我推测解码和思考/工具调用解析器,以实现高效推理。

0 人收藏 0 人点赞
#speculative-decoding

poolside/Laguna-S-2.1-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。

0 人收藏 0 人点赞
#speculative-decoding

基于自监督早期退出机制加速大语言模型推理

arXiv cs.CL · 2026-07-13 缓存

本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。

0 人收藏 0 人点赞
#speculative-decoding

我将一份40页的PDF扔给ChatGPT,它瞬间回复了。我们来揭秘是怎么做到的。

Reddit r/artificial · 2026-07-13

详细解析了为什么向ChatGPT上传大型PDF不会显著减慢响应时间,涉及流式传输、KV缓存和并行预填充阶段等技术。

0 人收藏 0 人点赞
#speculative-decoding

@ziv_ravid: https://x.com/ziv_ravid/status/2076074598618083627

X AI KOLs Timeline · 2026-07-11 缓存

解释了 DSpark 论文对推测解码的改进,以加速 LLM 推理,重点在于长草稿生成和自适应验证。

0 人收藏 0 人点赞
#speculative-decoding

Show HN: Reame – 一个随着运行而变快的CPU推理服务器

Hacker News Top · 2026-07-11 缓存

Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。

0 人收藏 0 人点赞
#speculative-decoding

针对 Qwen 的最快推测解码

Reddit r/LocalLLaMA · 2026-07-11

一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。

0 人收藏 0 人点赞
#speculative-decoding

DominoTree:基于Domino的条件树结构草稿用于投机解码

arXiv cs.CL · 2026-07-10 缓存

DominoTree引入了一种无训练的最佳优先草稿树用于投机解码,利用Domino的条件(非分解)修正,在Qwen3模型上实现了高达6.6倍的自回归解码加速,并且在所有评估方法中取得了最高的平均接受长度。

0 人收藏 0 人点赞
#speculative-decoding

DeLS-Spec: 解耦的长短上下文用于并行推测性草拟

arXiv cs.CL · 2026-07-09 缓存

DeLS-Spec通过在DFlash上添加轻量级局部头,将推测性解码中的长上下文和短上下文建模解耦,无需完全重新训练即可实现一致的加速。它仅需要对局部头进行标准的下一个词元预测训练,并在Qwen3基准测试中提高了接受长度。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈