speculative-decoding

标签

Cards List
#speculative-decoding

@Darkolorin: 今天我们发布了Uzu中的推测解码实现。这是自实验室成立以来最大的发布。Init…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

发布Uzu中的推测解码实现,初步支持Qwen3.6 27B,并即将支持Qwen3.8 27B和Muse Glimmer。

0 人收藏 0 人点赞
#speculative-decoding

@ViC305: 我做到了!! DeepSeek-V4-Flash-Vision EXL3 MixedK 现在在单个 DGX 上同时运行 VISION + DSpark 推测解码…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

用户 @ViC305 成功在单个 DGX Spark 上运行 DeepSeek-V4-Flash-Vision,结合 EXL3 MixedK 和 DSpark 推测解码,提升了性能并解决了多模态 AI 部署的技术问题。

0 人收藏 0 人点赞
#speculative-decoding

在两块 Tesla P40 上运行双模型文学翻译流水线:gemma-4-26B-A4B 达到约 40 词元/秒,配合 MTP 规范解码的 Qwen3.6-35B-A3B 则达到 50-70 词元/秒——完整 llama-server 参数见下文。

Reddit r/LocalLLaMA ↗ · 2026-09-02

该文章详细介绍了一款名为"Sunny Narrator"的开源工具,该工具利用基于Tesla P40 GPU的双模型AI流水线翻译小说,并通过优化的llama-server配置与MTP投机解码技术,实现了每秒40-70个token的生成速度。

0 人收藏 0 人点赞
#speculative-decoding

视觉并非负担:用于视觉语言模型无损推测解码的单次传递块起草方法

arXiv cs.AI ↗ · 2026-09-02 缓存

本文提出GLANCE,一种用于视觉语言模型无损推测解码的单次传递块起草方法,可实现高达2.93倍的生成加速,同时保持输出不变。

0 人收藏 0 人点赞
#speculative-decoding

@akshay_pachaar: https://x.com/akshay_pachaar/status/2094765529231929361

X AI KOLs Following ↗ · 2026-09-01 缓存

本文是一篇实践指南,介绍如何为代理工作运行本地AI模型,重点讨论硬件权衡,并引入Magnitude,一个开源推理服务器,它简化配置以优化性能。

0 人收藏 0 人点赞
#speculative-decoding

高效LLM推理的周期步进层跳过严格对照审计:ConfLayers与SWIFT及训练路由替代方案补充分析

arXiv cs.CL ↗ · 2026-09-01 缓存

本文呈现了一项严格对照的审计,比较了用于高效LLM推理的周期步进层跳过方法,如ConfLayers和SWIFT,并分析了训练的路由替代方案,发现SWIFT在准确性和真实推理速度上更优。

0 人收藏 0 人点赞
#speculative-decoding

投机解码的验证感知训练

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

验证感知训练(VAT)通过在训练中模拟顺序验证并自适应损失权重以匹配接受模式,改进投机解码的草稿模型,从而提升接受长度和推理加速。

0 人收藏 0 人点赞
#speculative-decoding

@Oluwaphilemon1: Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. A card that launched at aroun…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。

0 人收藏 0 人点赞
#speculative-decoding

@pochenai: 受 @percyliang 的 CS336 启发,我构建了一个用于 LLM 推理的静态性能模型——无动态批处理/分块,j…

X AI KOLs Following ↗ · 2026-08-28 缓存

受 CS336 启发,一个用于 LLM 推理的静态性能模型提供了 VRAM、time-to-first-token 和吞吐量的分析界限,涵盖多种配置,并针对公开基准进行校准。

0 人收藏 0 人点赞
#speculative-decoding

腾讯/Hy4-preview 770B-A49B 模型权重发布

Reddit r/LocalLLaMA ↗ · 2026-08-28 缓存

腾讯发布Hy4-preview,这是一款新的旗舰AI模型,采用混合专家架构,总参数为770B,每个token激活49B参数,具备如Gated DeepSeek Sparse Attention和identity Hyper-Connections等先进技术。

0 人收藏 0 人点赞
#speculative-decoding

TreeGraft:用于树基推测解码的自适应多草稿器嫁接技术

arXiv cs.CL ↗ · 2026-08-28 缓存

TreeGraft引入了一个用于树基推测解码的多草稿器框架,通过自适应调度优化草稿树质量,以实现比单草稿器方法显著的推理加速。

0 人收藏 0 人点赞
#speculative-decoding

Dflash 2 推测解码 by SamuelOliveirads · 拉取请求 #2345 · ikawrakow/ik_llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-08-27 缓存

这个拉取请求为 ik_llama.cpp 引入了 Dflash 2 推测解码和其他性能改进,ik_llama.cpp 是 llama.cpp 的一个分支,专注于增强 LLM 的 CPU 推理和量化技术。

0 人收藏 0 人点赞
#speculative-decoding

在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南

Reddit r/LocalLLaMA ↗ · 2026-08-26

本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。

0 人收藏 0 人点赞
#speculative-decoding

多模态推测解码是否已为基于扩散的并行草拟做好准备?一项调查与实证诊断

arXiv cs.AI ↗ · 2026-08-24 缓存

本文调查并实证诊断了多模态推测解码在基于扩散的并行草拟方法方面的就绪性,分析了各种多模态架构并提供了比较评估。

0 人收藏 0 人点赞
#speculative-decoding

LiLiCorr:用于推测解码的并行草稿轻量似然相关性

arXiv cs.CL ↗ · 2026-08-24 缓存

LiLiCorr是一种轻量似然模型,通过关联每个位置的边缘分布来提高推测解码的令牌连贯性,从而增加语言模型推理中的接受长度和吞吐量。

0 人收藏 0 人点赞
#speculative-decoding

GRAFT:基于目标蒸馏边评分的自适应 DLM 草稿树构建

arXiv cs.CL ↗ · 2026-08-24 缓存

GRAFT 引入了一个用于基于扩散语言模型的推测解码的草稿树构建框架,通过优化边选择和预算分配,实现了相对于自回归解码 2.13 倍至 6.36 倍的加速,同时开销很低。

0 人收藏 0 人点赞
#speculative-decoding

自推测加速推理模型

arXiv cs.CL ↗ · 2026-08-24 缓存

本文介绍了SSR,一种无需训练的自推测解码方法,利用思维链来加速大语言模型中的推理,在结构化生成任务上实现高达24.1%的延迟减少。

0 人收藏 0 人点赞
#speculative-decoding

在两个独立云区域通过公共WAN使用推测解码+CUDA图实现Qwen2.5-7B上28 TPS [P]

Reddit r/MachineLearning ↗ · 2026-08-23

分布式LLM推理框架ShardFlow通过推测解码与CUDA图缓解WAN延迟,在云区域间对Qwen2.5-7B实现28 TPS。

0 人收藏 0 人点赞
#speculative-decoding

Llama.cpp DSpark PC Tree 分支(速度提升高达3%-29.5%!)

Reddit r/LocalLLaMA ↗ · 2026-08-21

在一个 llama.cpp 分支中实现了 DSpark PC Tree,根据基准测试结果,在 Qwen 3.0 模型上显示了推理速度最高提升29.5%的性能优势。

0 人收藏 0 人点赞
#speculative-decoding

@Prince_Canuma:LFM2.5 DSpark by @liquidai 即将加入 mlx-vlm v0.6.16,支持在 M5 Max 上进行精确推测解码,速度提升高达 3.7× …

X AI KOLs Following ↗ · 2026-08-21 缓存

LFM2.5 DSpark by liquidai 已集成到 mlx-vlm v0.6.16 中,使 M5 Max 上的推测解码速度提升高达 3.7×,且输出零漂移,用于设备端视觉语言模型推理。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈