speculative-decoding

标签

Cards List
#speculative-decoding

为推测解码恢复离策略监督信号

arXiv cs.CL ↗ · 8小时前 缓存

本文提出一种基于 rollout 的训练框架(Anchor-Label Relabelling 与 In-Rollout Anchors),用于在离策略语料上训练的推测解码块草稿模型中恢复完整的监督信号,在不改动训练文本的情况下,将贪心解码下的接受长度较 DFlash 最多提升 36.5%。

0 人收藏 0 人点赞
#speculative-decoding

DEdit:用于投机解码的迭代草稿编辑

arXiv cs.CL ↗ · 8小时前 缓存

DEdit 提出了一种基于扩散的草稿生成器,用于投机解码,通过 token 到 token 的预测迭代式地编辑草稿,并采用 ProposalMix 训练方案在修复错误的同时保留正确的 token。在七个基准测试上,该方法在 Qwen3-4B 和 Qwen3-8B 上分别实现了 5.72× 和 5.97× 的宏平均加速。

0 人收藏 0 人点赞
#speculative-decoding

M5 Ultra 实测:Qwen3.8 Flash Next 对决 Laguna S 2.1

Reddit r/LocalLLaMA ↗ · 14小时前

在同一台 Mac Studio M5 Ultra 256GB 上,使用相同框架对比了 Qwen3.8-Flash-Next(182GB oQ8e)与 Laguna-S-2.1 GGUF 在最高 262K 上下文下的表现。Qwen 在预填充阶段保持约 4,200 tok/s 的线性速度,解码稳定;而 Laguna 则呈超线性退化;质量方面双方 4/4 打平,但答题风格迥异。

0 人收藏 0 人点赞
#speculative-decoding

@no_stp_on_snek:同样的两块 GB10。GLM-5.3-Flash,两套技术栈。各进行一次流式调用,温度 0.2,384 tokens,提示词约 3.7k tokens…

X AI KOLs Timeline ↗ · 23小时前 缓存

两套社区推理栈在同一对 NVIDIA DGX Spark 上运行 320B GLM-5.3-Flash 的对比测试,比较 Entrpi 的 EXL3 方案与使用 DFlash2 草稿模型的 TensorFold 在文本、代码及预填充负载下的表现。

0 人收藏 0 人点赞
#speculative-decoding

Tensorfold 在 M5 Pro Mac mini 上运行 Qwen3.8-27B 表现极佳,tps 超过 MTPLX

Reddit r/LocalLLaMA ↗ · 23小时前

一位用户报告称,开源推理引擎 TensorFold 在 M5 Pro Mac mini 上运行 4-bit 的 Qwen3.8-27B,并配合 DFlash2 草稿模型,可达 40-60 tok/s,超越 MTPLX,性能媲美 RTX 3090 Ti。这凸显了 Apple Silicon 上本地 LLM 推理性能的快速提升。

0 人收藏 0 人点赞
#speculative-decoding

AA-AgentPerf-Local:在笔记本和工作站上对本地 AI 智能体进行基准测试

Reddit r/LocalLLaMA ↗ · 昨天 缓存

Artificial Analysis 开源了 AA-AgentPerf-Local,这是一款推理基准测试工具,通过重放真实智能体轨迹来测量智能体式 AI 在笔记本和工作站上的运行速度,并给出了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步测试结果。

0 人收藏 0 人点赞
#speculative-decoding

并行生成草稿,通过深度进行条件化:用于推测解码的相邻因果注入

arXiv cs.LG ↗ · 昨天 缓存

提出DSpine,一种通过网络深度注入相邻因果条件的并行推测解码drafter,在SGLang中实现高效并行执行,较DFlash在Qwen3-8B上平均接受长度提升27.8%、吞吐量提升23.3%。

0 人收藏 0 人点赞
#speculative-decoding

EXL3 现已支持 ninfer-ext

Reddit r/LocalLLaMA ↗ · 昨天 缓存

ninfer-ext 是 NInfer 的扩展分支,新增了对更大 Qwen 模型的支持、更快的推测式解码、Agent 服务功能,以及针对 Qwen3.8-27B 在 NVIDIA RTX 5090 上的 EXL3 量化支持。

0 人收藏 0 人点赞
#speculative-decoding

Ornith-1.5 DFlash

Reddit r/LocalLLaMA ↗ · 2天前

Ornith-1.5 模型集成了用于推测解码的 DFlash 草稿模型,已在 Hugging Face 上发布,提供 9B、397B 和 35B-A3B 尺寸。

0 人收藏 0 人点赞
#speculative-decoding

Mentored Decoding:更快推理遇上Boosting

arXiv cs.LG ↗ · 2天前 缓存

本文介绍了mentored decoding,这是一种有损推测解码的正式方法,通过允许与目标模型的受控偏差来提高语言模型的推理速度,将其与提升理论联系起来,并证明了优化的关键性质。

0 人收藏 0 人点赞
#speculative-decoding

llama.cpp 中提示查询草稿生成速度提升 42 倍

Reddit r/LocalLLaMA ↗ · 4天前 缓存

本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。

0 人收藏 0 人点赞
#speculative-decoding

WaveFront Decoding:针对循环语言模型的并行化自推测解码

Hugging Face Daily Papers ↗ · 5天前 缓存

WaveFront Decoding 引入了一个无需训练的自推测解码框架,针对循环语言模型,通过并发批量处理草拟和验证来减少延迟,在 Huginn-3.5B 上实现了高达 4.81 倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

@Anbeeld: BeeLlama v0.4.7 发布了!在使用 MTP 和 DFlash 时,您可以节省数 GB 的 VRAM!在图像中展示的示例中…

X AI KOLs Timeline ↗ · 5天前

BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。

0 人收藏 0 人点赞
#speculative-decoding

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 6天前 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#speculative-decoding

当并行起草器遇上并行推测解码

arXiv cs.CL ↗ · 2026-09-24 缓存

DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。

0 人收藏 0 人点赞
#speculative-decoding

@dzhng: 提供商/实验室经常在发布后根据使用模式和硬件类型调整其量化/推测解码策略……

X AI KOLs Following ↗ · 2026-09-23 缓存

该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。

0 人收藏 0 人点赞
#speculative-decoding

TSS:目标端稀疏化在特定领域大型语言模型推测解码中的应用

arXiv cs.CL ↗ · 2026-09-23 缓存

本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。

0 人收藏 0 人点赞
#speculative-decoding

包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)

Reddit r/LocalLLaMA ↗ · 2026-09-22

一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。

0 人收藏 0 人点赞
#speculative-decoding

推测的限制:在混合专家模型中界定推测解码

arXiv cs.LG ↗ · 2026-09-22 缓存

本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。

0 人收藏 0 人点赞
#speculative-decoding

TreeSpark: 面向半自回归推测解码的校准式负载自适应草稿树

arXiv cs.CL ↗ · 2026-09-22 缓存

TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈