speculative-decoding

标签

Cards List
#speculative-decoding

Tensorfold 在 M5 Pro Mac mini 上运行 Qwen3.8-27B 表现极佳,tps 超过 MTPLX

Reddit r/LocalLLaMA ↗ · 3小时前

一位用户报告称,开源推理引擎 TensorFold 在 M5 Pro Mac mini 上运行 4-bit 的 Qwen3.8-27B,并配合 DFlash2 草稿模型,可达 40-60 tok/s,超越 MTPLX,性能媲美 RTX 3090 Ti。这凸显了 Apple Silicon 上本地 LLM 推理性能的快速提升。

0 人收藏 0 人点赞
#speculative-decoding

AA-AgentPerf-Local:在笔记本和工作站上对本地 AI 智能体进行基准测试

Reddit r/LocalLLaMA ↗ · 6小时前 缓存

Artificial Analysis 开源了 AA-AgentPerf-Local,这是一款推理基准测试工具,通过重放真实智能体轨迹来测量智能体式 AI 在笔记本和工作站上的运行速度,并给出了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步测试结果。

0 人收藏 0 人点赞
#speculative-decoding

并行生成草稿,通过深度进行条件化:用于推测解码的相邻因果注入

arXiv cs.LG ↗ · 11小时前 缓存

提出DSpine,一种通过网络深度注入相邻因果条件的并行推测解码drafter,在SGLang中实现高效并行执行,较DFlash在Qwen3-8B上平均接受长度提升27.8%、吞吐量提升23.3%。

0 人收藏 0 人点赞
#speculative-decoding

EXL3 现已支持 ninfer-ext

Reddit r/LocalLLaMA ↗ · 16小时前 缓存

ninfer-ext 是 NInfer 的扩展分支,新增了对更大 Qwen 模型的支持、更快的推测式解码、Agent 服务功能,以及针对 Qwen3.8-27B 在 NVIDIA RTX 5090 上的 EXL3 量化支持。

0 人收藏 0 人点赞
#speculative-decoding

Ornith-1.5 DFlash

Reddit r/LocalLLaMA ↗ · 昨天

Ornith-1.5 模型集成了用于推测解码的 DFlash 草稿模型,已在 Hugging Face 上发布,提供 9B、397B 和 35B-A3B 尺寸。

0 人收藏 0 人点赞
#speculative-decoding

Mentored Decoding:更快推理遇上Boosting

arXiv cs.LG ↗ · 昨天 缓存

本文介绍了mentored decoding,这是一种有损推测解码的正式方法,通过允许与目标模型的受控偏差来提高语言模型的推理速度,将其与提升理论联系起来,并证明了优化的关键性质。

0 人收藏 0 人点赞
#speculative-decoding

llama.cpp 中提示查询草稿生成速度提升 42 倍

Reddit r/LocalLLaMA ↗ · 3天前 缓存

本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。

0 人收藏 0 人点赞
#speculative-decoding

WaveFront Decoding:针对循环语言模型的并行化自推测解码

Hugging Face Daily Papers ↗ · 4天前 缓存

WaveFront Decoding 引入了一个无需训练的自推测解码框架,针对循环语言模型,通过并发批量处理草拟和验证来减少延迟,在 Huginn-3.5B 上实现了高达 4.81 倍的加速。

0 人收藏 0 人点赞
#speculative-decoding

@Anbeeld: BeeLlama v0.4.7 发布了!在使用 MTP 和 DFlash 时,您可以节省数 GB 的 VRAM!在图像中展示的示例中…

X AI KOLs Timeline ↗ · 5天前

BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。

0 人收藏 0 人点赞
#speculative-decoding

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 6天前 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#speculative-decoding

当并行起草器遇上并行推测解码

arXiv cs.CL ↗ · 6天前 缓存

DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。

0 人收藏 0 人点赞
#speculative-decoding

@dzhng: 提供商/实验室经常在发布后根据使用模式和硬件类型调整其量化/推测解码策略……

X AI KOLs Following ↗ · 6天前 缓存

该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。

0 人收藏 0 人点赞
#speculative-decoding

TSS:目标端稀疏化在特定领域大型语言模型推测解码中的应用

arXiv cs.CL ↗ · 2026-09-23 缓存

本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。

0 人收藏 0 人点赞
#speculative-decoding

包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)

Reddit r/LocalLLaMA ↗ · 2026-09-22

一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。

0 人收藏 0 人点赞
#speculative-decoding

推测的限制:在混合专家模型中界定推测解码

arXiv cs.LG ↗ · 2026-09-22 缓存

本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。

0 人收藏 0 人点赞
#speculative-decoding

TreeSpark: 面向半自回归推测解码的校准式负载自适应草稿树

arXiv cs.CL ↗ · 2026-09-22 缓存

TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。

0 人收藏 0 人点赞
#speculative-decoding

【Splash Engine】Qwen3.8-27B在Apple Silicon上原生8位运行,速度达37-55 tok/s:扩展Splash至Q8、256k上下文缩放及"推理悬崖"

Reddit r/LocalLLaMA ↗ · 2026-09-21

扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。

0 人收藏 0 人点赞
#speculative-decoding

复制还是不复制:通过内在模型信号控制推测解码

arXiv cs.CL ↗ · 2026-09-18 缓存

SwitchSD 是一种用于 LLM 推测解码的自适应框架,利用内在模型信号在神经草稿与基于上下文的复制之间动态切换,与 EAGLE3 等基线相比,吞吐量最高可提升 15%。

0 人收藏 0 人点赞
#speculative-decoding

Zarya:一种混合自回归-掩码扩散语言模型,支持灵活训练与双模推理

arXiv cs.CL ↗ · 2026-09-18 缓存

Zarya 是一种混合语言模型,联合优化自回归和掩码扩散目标,实现灵活训练和双模推理,已公开发布0.6B、1.7B和4B大小的模型。

0 人收藏 0 人点赞
#speculative-decoding

Shapelearn Qwen 3.8 27B(13.1 GB 显存)

Hacker News Top ↗ · 2026-09-18 缓存

ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈