如果您在Strix Halo上运行Qwen 3.8 Flash Next,请使用此软件进行推理。它比llama.cpp快得多,尤其是在高上下文情况下。

Reddit r/LocalLLaMA 工具

摘要

一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。

这就是该项目。我与它无关。我只是一位惊叹的用户。https://github.com/gufo-org/gufo/blob/main/docs/models/qwen3.8-flash-next/BENCHMARKS.md 那些基准数字在实际工作负载中经得起考验。以下是我聊天时得到的一些数据。"[6204 chunks in 119.0 s | encode: 1239 tok/s | decode: 57 tok/s]" 这是开启了MTP的情况。PP速度尤其快。那PP速度是我用过的最快Strix Halo专用llama.cpp分支的两倍。不用说,与主线llama.cpp相比,提升更大。它也适用于其他模型,但目前数量不多。您可以在他们的项目页面上找到列表。
查看原文

相似文章