speculative-decoding

标签

Cards List
#speculative-decoding

针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s

Reddit r/LocalLLaMA · 2026-08-04 缓存

DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。

0 人收藏 0 人点赞
#speculative-decoding

OoO-Spec:用于快速工具调用的无序语义推测

arXiv cs.CL · 2026-08-04 缓存

介绍了 OoO-Spec,一种通过小型辅助模型以无序方式计算语义槽位来加速 LLM 工具调用的方法,相比自回归解码实现了最高 5.34 倍的加速,并在多个目标和基准测试中超越了现有的草稿模型方法。

0 人收藏 0 人点赞
#speculative-decoding

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

0 人收藏 0 人点赞
#speculative-decoding

超越KV重建:投机解码中MLA草稿模型的功能重构

arXiv cs.LG · 2026-07-31 缓存

本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。

0 人收藏 0 人点赞
#speculative-decoding

重新审视推测解码中的有损验证:机制、权衡与失效模式

arXiv cs.CL · 2026-07-30 缓存

本文分析了推测解码中的有损验证方案,将其分为基于截断的验证和协作验证两类,并指出了保持生成质量的陷阱和原则。

0 人收藏 0 人点赞
#speculative-decoding

@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…

X AI KOLs · 2026-07-29 缓存

OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。

0 人收藏 0 人点赞
#speculative-decoding

PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用

Reddit r/LocalLLaMA · 2026-07-29

最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。

0 人收藏 0 人点赞
#speculative-decoding

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL · 2026-07-29 缓存

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。

0 人收藏 0 人点赞
#speculative-decoding

K3 部署的推理引擎指南(10 分钟阅读)

TLDR AI · 2026-07-29 缓存

Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具有 100 万 token 的上下文窗口,现已获得 vLLM 的 day-0 支持。本指南详细介绍了 vLLM 如何服务于 K3 的新颖架构,包括 Kimi Delta Attention、Attention Residuals 以及推测解码,最高可达 370 tok/s。

0 人收藏 0 人点赞
#speculative-decoding

CohereLabs/North-Mini-Code-1.0-eagle · Hugging Face

Reddit r/LocalLLaMA · 2026-07-28 缓存

Cohere Labs发布North-Mini-Code-1.0-eagle,这是一个用于推测解码的草稿模型,以加速代码生成。它采用三个密集transformer层,带有滑动窗口注意力机制,并兼容fp8/w4a4目标模型。

0 人收藏 0 人点赞
#speculative-decoding

spec: 添加DSpark推测解码 by wjinxu · 拉取请求 #25173 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-07-28 缓存

通过拉取请求向llama.cpp添加DSpark推测解码支持,提升推理性能。

0 人收藏 0 人点赞
#speculative-decoding

PRESTO: 前缀对齐的树状草稿生成用于扩散推测解码

arXiv cs.AI · 2026-07-28 缓存

PRESTO 提出了一种用于扩散推测解码的前缀对齐树状草稿生成框架,在专用扩散草稿模型上实现了高达 1.5 倍的加速,在自推测扩散大语言模型上实现了 1.12 倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

Qwen3.6-27B 推测解码在更大量化下性能提升

Reddit r/LocalLLaMA · 2026-07-27

Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。

0 人收藏 0 人点赞
#speculative-decoding

针对推测性解码中接受崩溃的对抗性提示

arXiv cs.CL · 2026-07-27 缓存

介绍了ADSD,一种提示后缀攻击,通过迫使草稿模型提出目标模型不太可能接受的令牌,在推测性解码中引发接受崩溃,从而增加推理时间同时保持任务质量。

0 人收藏 0 人点赞
#speculative-decoding

我们如何打造 GLM-5.2 全新最快的 API(5分钟阅读)

TLDR AI · 2026-07-27 缓存

Baseten 详细介绍了如何为 GLM-5.2 构建最快的 API,其性能超过发布时的两倍,并推出了针对编码和智能体优化的低延迟 Fast 版本,同时计划进一步改进。

0 人收藏 0 人点赞
#speculative-decoding

llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平

Reddit r/LocalLLaMA · 2026-07-25

对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。

0 人收藏 0 人点赞
#speculative-decoding

SonicSampler:用于LLM采样和推测性验证的统一Tile感知内核

arXiv cs.AI · 2026-07-24 缓存

SonicSampler 提出了一套统一的Tile感知Triton内核,垂直融合了整个LLM采样流水线,支持动态的逐请求行为和推测性验证,相较于最先进的基线实现了高达16倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

@jundotkim: oMLX 0.5.2 已发布。(很抱歉沉默了这么久!)https://github.com/jundot/omlx/releases… oMLX 是最方便的...

X AI KOLs Timeline · 2026-07-21 缓存

oMLX 0.5.2 版本新增了实时菜单栏活动、重新组织的模型菜单、Bonsai 低位内核,以及通过自定义 Metal 内核和原生推测解码实现的性能提升,使其成为在 Mac 上运行 MLX 模型的最快方式。

0 人收藏 0 人点赞
#speculative-decoding

I benchmarked Unsloth's Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn't.

Reddit r/LocalLLaMA · 2026-07-21

详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。

0 人收藏 0 人点赞
#speculative-decoding

@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…

X AI KOLs Timeline · 2026-07-21 缓存

DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈