如果您在Strix Halo上运行Qwen 3.8 Flash Next,请使用此软件进行推理。它比llama.cpp快得多,尤其是在高上下文情况下。
摘要
一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。
这就是该项目。我与它无关。我只是一位惊叹的用户。https://github.com/gufo-org/gufo/blob/main/docs/models/qwen3.8-flash-next/BENCHMARKS.md 那些基准数字在实际工作负载中经得起考验。以下是我聊天时得到的一些数据。"[6204 chunks in 119.0 s | encode: 1239 tok/s | decode: 57 tok/s]" 这是开启了MTP的情况。PP速度尤其快。那PP速度是我用过的最快Strix Halo专用llama.cpp分支的两倍。不用说,与主线llama.cpp相比,提升更大。它也适用于其他模型,但目前数量不多。您可以在他们的项目页面上找到列表。
相似文章
@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash
一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
Qwen3.8-Flash-Next 在 Strix Halo 上支持 100万上下文:解码速度达 38 tok/s,预填充仅需 18 分钟 (Halogen 0.12.0)
Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。
@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。