speculative-decoding

标签

Cards List
#speculative-decoding

Shapelearn Qwen 3.8 27B(13.1 GB 显存)

Hacker News Top ↗ · 2026-09-18 缓存

ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。

0 人收藏 0 人点赞
#speculative-decoding

@ngxson: 关于 llama.cpp 投机解码 (MTP, dflash, dspark) 在 dotAI 的演讲回放即将发布!

X AI KOLs Following ↗ · 2026-09-17 缓存

在 dotAI 大会上关于 llama.cpp 投机解码方法 (MTP, dflash, dspark) 的演讲回放即将发布。

0 人收藏 0 人点赞
#speculative-decoding

Intel 发布 OpenVINO 2026.4

Reddit r/LocalLLaMA ↗ · 2026-09-17

Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。

0 人收藏 0 人点赞
#speculative-decoding

推理工程帕累托图谱:哪些优化在成本、质量和延迟前沿占主导?

arXiv cs.AI ↗ · 2026-09-17 缓存

本文构建了大语言模型推理优化的成本-质量-延迟帕累托图谱,使用校准的模拟器评估不同硬件和场景下的配置和组合。

0 人收藏 0 人点赞
#speculative-decoding

FlexEE:用于卸载感知LLM推理的自推测与KV兼容早期退出框架

arXiv cs.AI ↗ · 2026-09-16 缓存

FlexEE介绍了一种自推测和KV缓存兼容的早期退出框架,用于卸载部署中的高效LLM推理,在Llama模型上实现了显著加速,且精度损失最小化。

0 人收藏 0 人点赞
#speculative-decoding

在 M3 Ultra 上原生支持 DSpark MTP 的 DeepSeek V4.1F Q4(40 t/s / 800 t/s)

Reddit r/LocalLLaMA ↗ · 2026-09-15

作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。

0 人收藏 0 人点赞
#speculative-decoding

R9V 更新:现在在双 R9700 + 128GB RAM 上,Qwen3.8 Flash Next IQ4_XS 的文本生成中达到约 100 tok/s。修复了 n-gram SSD 流式传输的崩溃问题,改进了诊断功能,并添加了固定图像支持。现在支持 Q4_K_XL,文本生成达到 50 tok/s。

Reddit r/LocalLLaMA ↗ · 2026-09-14 缓存

R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。

0 人收藏 0 人点赞
#speculative-decoding

无损推测解码有多无损?数值精度在Orthrus中的作用

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文研究了Orthrus的无损性,Orthrus是一种用于推理加速的混合自回归-扩散模型,发现其需要高数值精度(FP32)来实现精确轨迹匹配,而BF16精度偏差并不影响下游性能。

0 人收藏 0 人点赞
#speculative-decoding

这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA ↗ · 2026-09-12

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

0 人收藏 0 人点赞
#speculative-decoding

@TheDavidTai:我们刚在 https://CUDA.fast 上达到了100%!另外看看这个快照中代表的所有不同模型。

X AI KOLs Following ↗ · 2026-09-11 缓存

Qwen 3.8 Flash Next 模型在 CUDA.fast 基准测试中取得了100%的得分,在 DGX Spark 上实现了117.8%的综合速度提升,利用了推测性解码技术。

0 人收藏 0 人点赞
#speculative-decoding

Osprey:目标无关的预训练让推测解码中的草稿模型更强大

arXiv cs.CL ↗ · 2026-09-10 缓存

Osprey引入了一种针对推测解码中草稿模型的目标无关预训练方法,通过从现成模型中引导并适应最少的特定目标工作来提高效率,在多个大语言模型上实现了显著的接受率提升。

0 人收藏 0 人点赞
#speculative-decoding

X-CoSD:通信高效的跨词汇协作推测解码

arXiv cs.CL ↗ · 2026-09-10 缓存

本文介绍了X-CoSD,一个通信高效的跨词汇协作推测解码框架,通过拆分残差重采样来优化分布式大语言模型推理,以减少开销,同时保持服务器端大语言模型的质量。

0 人收藏 0 人点赞
#speculative-decoding

终于明白了为什么我的编码代理在样板代码上打字快,在新逻辑上打字慢

Reddit r/AI_Agents ↗ · 2026-09-09

作者解释了投机解码如何影响编码代理的速度,样板代码上较高的接受率导致打字更快,并讨论了其他影响性能的因素,如缓存未命中。

0 人收藏 0 人点赞
#speculative-decoding

Qwen3.8-Flash-Next在llama.cpp vs SGLang vs FreeToken中的比较:完整上下文下首token时间从35秒到258秒。我对即将引入引擎的新PR的研究发现。

Reddit r/LocalLLaMA ↗ · 2026-09-08

在完整上下文下对SGLang、llama.cpp和FreeToken在Qwen3.8-Flash-Next上的基准测试显示,SGLang实现最快的首token时间为35.4秒,而llama.cpp基线耗时258.4秒,推测解码提供了性能提升。

0 人收藏 0 人点赞
#speculative-decoding

接受长度越高,文本越慢:Ling在单台Spark上的n=1/2/3 MTP测试

Reddit r/LocalLLaMA ↗ · 2026-09-07

对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。

0 人收藏 0 人点赞
#speculative-decoding

大规模长上下文强化学习后训练中投机解码的在线草稿协同训练

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

本文提出了一种通过在线草稿协同训练加速大规模强化学习后训练中投机解码的系统,利用上下文并行注意力扩展和跨阶段特征传输。

0 人收藏 0 人点赞
#speculative-decoding

Jina-OCR-v1:采用推测解码与密集可验证奖励的高效文档解析

arXiv cs.CL ↗ · 2026-09-04 缓存

Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。

0 人收藏 0 人点赞
#speculative-decoding

边距而非窗口:无训练的每步有损推测解码

arXiv cs.CL ↗ · 2026-09-04 缓存

AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。

0 人收藏 0 人点赞
#speculative-decoding

@PyTorch:TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架。本次发布,一项合作...

X AI KOLs Following ↗ · 2026-09-03 缓存

TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架,与 vllm 合作发布,并在 NVIDIA GB200 硬件上使用 Kimi K3 草稿模型进行了演示。

0 人收藏 0 人点赞
#speculative-decoding

@Darkolorin: 今天我们发布了Uzu中的推测解码实现。这是自实验室成立以来最大的发布。Init…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

发布Uzu中的推测解码实现,初步支持Qwen3.6 27B,并即将支持Qwen3.8 27B和Muse Glimmer。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈