speculative-decoding

标签

Cards List
#speculative-decoding

llama.cpp 中提示查询草稿生成速度提升 42 倍

Reddit r/LocalLLaMA ↗ · 22小时前 缓存

本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。

0 人收藏 0 人点赞
#speculative-decoding

@Anbeeld: BeeLlama v0.4.7 发布了!在使用 MTP 和 DFlash 时,您可以节省数 GB 的 VRAM!在图像中展示的示例中…

X AI KOLs Timeline ↗ · 2天前

BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。

0 人收藏 0 人点赞
#speculative-decoding

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 3天前 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#speculative-decoding

当并行起草器遇上并行推测解码

arXiv cs.CL ↗ · 3天前 缓存

DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。

0 人收藏 0 人点赞
#speculative-decoding

@dzhng: 提供商/实验室经常在发布后根据使用模式和硬件类型调整其量化/推测解码策略……

X AI KOLs Following ↗ · 4天前 缓存

该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。

0 人收藏 0 人点赞
#speculative-decoding

TSS:目标端稀疏化在特定领域大型语言模型推测解码中的应用

arXiv cs.CL ↗ · 4天前 缓存

本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。

0 人收藏 0 人点赞
#speculative-decoding

包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)

Reddit r/LocalLLaMA ↗ · 5天前

一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。

0 人收藏 0 人点赞
#speculative-decoding

推测的限制:在混合专家模型中界定推测解码

arXiv cs.LG ↗ · 5天前 缓存

本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。

0 人收藏 0 人点赞
#speculative-decoding

TreeSpark: 面向半自回归推测解码的校准式负载自适应草稿树

arXiv cs.CL ↗ · 5天前 缓存

TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。

0 人收藏 0 人点赞
#speculative-decoding

【Splash Engine】Qwen3.8-27B在Apple Silicon上原生8位运行,速度达37-55 tok/s:扩展Splash至Q8、256k上下文缩放及"推理悬崖"

Reddit r/LocalLLaMA ↗ · 6天前

扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。

0 人收藏 0 人点赞
#speculative-decoding

复制还是不复制:通过内在模型信号控制推测解码

arXiv cs.CL ↗ · 2026-09-18 缓存

SwitchSD 是一种用于 LLM 推测解码的自适应框架,利用内在模型信号在神经草稿与基于上下文的复制之间动态切换,与 EAGLE3 等基线相比,吞吐量最高可提升 15%。

0 人收藏 0 人点赞
#speculative-decoding

Zarya:一种混合自回归-掩码扩散语言模型,支持灵活训练与双模推理

arXiv cs.CL ↗ · 2026-09-18 缓存

Zarya 是一种混合语言模型,联合优化自回归和掩码扩散目标,实现灵活训练和双模推理,已公开发布0.6B、1.7B和4B大小的模型。

0 人收藏 0 人点赞
#speculative-decoding

Shapelearn Qwen 3.8 27B(13.1 GB 显存)

Hacker News Top ↗ · 2026-09-18 缓存

ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。

0 人收藏 0 人点赞
#speculative-decoding

@ngxson: 关于 llama.cpp 投机解码 (MTP, dflash, dspark) 在 dotAI 的演讲回放即将发布!

X AI KOLs Following ↗ · 2026-09-17 缓存

在 dotAI 大会上关于 llama.cpp 投机解码方法 (MTP, dflash, dspark) 的演讲回放即将发布。

0 人收藏 0 人点赞
#speculative-decoding

Intel 发布 OpenVINO 2026.4

Reddit r/LocalLLaMA ↗ · 2026-09-17

Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。

0 人收藏 0 人点赞
#speculative-decoding

推理工程帕累托图谱:哪些优化在成本、质量和延迟前沿占主导?

arXiv cs.AI ↗ · 2026-09-17 缓存

本文构建了大语言模型推理优化的成本-质量-延迟帕累托图谱,使用校准的模拟器评估不同硬件和场景下的配置和组合。

0 人收藏 0 人点赞
#speculative-decoding

FlexEE:用于卸载感知LLM推理的自推测与KV兼容早期退出框架

arXiv cs.AI ↗ · 2026-09-16 缓存

FlexEE介绍了一种自推测和KV缓存兼容的早期退出框架,用于卸载部署中的高效LLM推理,在Llama模型上实现了显著加速,且精度损失最小化。

0 人收藏 0 人点赞
#speculative-decoding

在 M3 Ultra 上原生支持 DSpark MTP 的 DeepSeek V4.1F Q4(40 t/s / 800 t/s)

Reddit r/LocalLLaMA ↗ · 2026-09-15

作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。

0 人收藏 0 人点赞
#speculative-decoding

R9V 更新:现在在双 R9700 + 128GB RAM 上,Qwen3.8 Flash Next IQ4_XS 的文本生成中达到约 100 tok/s。修复了 n-gram SSD 流式传输的崩溃问题,改进了诊断功能,并添加了固定图像支持。现在支持 Q4_K_XL,文本生成达到 50 tok/s。

Reddit r/LocalLLaMA ↗ · 2026-09-14 缓存

R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。

0 人收藏 0 人点赞
#speculative-decoding

无损推测解码有多无损?数值精度在Orthrus中的作用

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文研究了Orthrus的无损性,Orthrus是一种用于推理加速的混合自回归-扩散模型,发现其需要高数值精度(FP32)来实现精确轨迹匹配,而BF16精度偏差并不影响下游性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈