新功能:Llama.cpp 自适应推测,加速推理
摘要
Llama.cpp 引入自适应推测,可动态调整令牌预测以实现更快的推理速度,最高可提升50%的性能,尤其适用于Qwen3.8等模型。
我们一直在为Qwen3.8及其他模型开发一些性能优化。引入的主要新功能是Llama.cpp的自适应推测。这是什么?MTP和DFlash在加速推理工作方面表现出色,尤其适用于稠密模型。然而,不同的内容类型需要不同的设置,而Llama.cpp此前仅支持单一固定值。这个分支版本引入了自适应推测功能。您只需设置最小值和最大值,引擎将自动调整建议的令牌数量。这使得令牌生成速度相较于主线版本最高可提升50%,在Qwen3.8模型上效果尤为明显。在Strix Halo平台上,针对结构化内容的生成速度从44 tokens/s提升至65 tokens/s。Github:https://github.com/LaurentZuijdwijk/llama.cpp 发布版:https://github.com/LaurentZuijdwijk/llama.cpp/releases
相似文章
Llama.cpp PR 带来 8% 速度提升
一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。
@populartourist: llama.cpp 发布版本 b9235 添加了一些用于提升推理性能的新工具。使用 llama.c 对 RTX 5090 上的 Qwen3.6 27B 进行了基准测试…
llama.cpp 发布版本 b9235 引入了推测性 n-gram 调优,在 RTX 5090 上的 Qwen3.6 27B 上实现了高达约 7 倍的吞吐量提升,其中 k4v96 配置在 10k 和 70k token 测试中表现出最佳的持续性能。
一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。
Llama.cpp DSpark PC Tree 分支(速度提升高达3%-29.5%!)
在一个 llama.cpp 分支中实现了 DSpark PC Tree,根据基准测试结果,在 Qwen 3.0 模型上显示了推理速度最高提升29.5%的性能优势。
BeeLlama.cpp:支持推理和视觉的先进 DFlash 与 TurboQuant。在 RTX 3090 上以 200k 上下文运行 Qwen 3.6 27B Q5,速度比基线快 2-3 倍(峰值 135 tps!)
BeeLlama.cpp 是一个专注于性能的 llama.cpp 分支,引入了 DFlash 投机解码和 TurboQuant KV 缓存压缩技术,使得在消费级硬件上也能高速本地运行像 Qwen 3.6 27B 这样的大型模型。