@ngxson: 关于 llama.cpp 投机解码 (MTP, dflash, dspark) 在 dotAI 的演讲回放即将发布!
摘要
在 dotAI 大会上关于 llama.cpp 投机解码方法 (MTP, dflash, dspark) 的演讲回放即将发布。
我在 dotAI 关于 llama.cpp 投机解码 (MTP, dflash, dspark) 的演讲回放即将发布!🦙🦙 https://t.co/KH3F6H046w
查看缓存全文
缓存时间: 2026/09/18 00:27
我在 dotAI 分享的关于 llama.cpp 推测解码(MTP、dflash、dspark)的演讲 🦙🦙 回放即将上线!
https://t.co/KH3F6H046w
相似文章
我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。
llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。
@nullfoundry: 各位好。我想分享一下我新的 dflash 方案(昨天已合并到官方 llama.cpp) llama-server -hf uns…
分享在 llama.cpp 中使用 dflash 投机解码的新方案,在单张 RTX 3090 上结合 Qwen3.6-27B GGUF 和草稿模型达到约 70 TPS。
spec: 添加DSpark推测解码 by wjinxu · 拉取请求 #25173 · ggml-org/llama.cpp
通过拉取请求向llama.cpp添加DSpark推测解码支持,提升推理性能。
@pupposandro: https://x.com/pupposandro/status/2054241934164492328
该文章宣布了 llama.cpp 对 AMD Strix Halo 集成 GPU (iGPU) 上的 DFlash 和 PFlash 投机解码的支持,并展示了使用 ROCm 时推理性能的显著提升。
llama + spec: 由 am17an 提交的 MTP 支持 · Pull Request #22673 · ggml-org/llama.cpp
拉取请求为 llama.cpp 添加多令牌预测(MTP)支持,启用推测解码以加速推理。