新功能:Llama.cpp 自适应推测,加速推理

Reddit r/LocalLLaMA 工具

摘要

Llama.cpp 引入自适应推测,可动态调整令牌预测以实现更快的推理速度,最高可提升50%的性能,尤其适用于Qwen3.8等模型。

我们一直在为Qwen3.8及其他模型开发一些性能优化。引入的主要新功能是Llama.cpp的自适应推测。这是什么?MTP和DFlash在加速推理工作方面表现出色,尤其适用于稠密模型。然而,不同的内容类型需要不同的设置,而Llama.cpp此前仅支持单一固定值。这个分支版本引入了自适应推测功能。您只需设置最小值和最大值,引擎将自动调整建议的令牌数量。这使得令牌生成速度相较于主线版本最高可提升50%,在Qwen3.8模型上效果尤为明显。在Strix Halo平台上,针对结构化内容的生成速度从44 tokens/s提升至65 tokens/s。Github:https://github.com/LaurentZuijdwijk/llama.cpp 发布版:https://github.com/LaurentZuijdwijk/llama.cpp/releases
查看原文

相似文章

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。