针对Strix Halo - 官方llama.cpp并非理想选择及如何实现最高吞吐量
摘要
本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。
我一直在就Strix Halo (gfx1150) 的最佳设置发表许多评论,根据我的观察,我们社区中有90%的人在使用官方llama.cpp,但它并未针对Strix Halo进行优化,官方llama.cpp极难达到硬件理论性能的50%,浪费了该设备的硅芯片资源。以下是能将Strix Halo的速度提升至全新境界的替代方案,我将链接用户满意评论以证明结果真实:
https://github.com/peonist-ai/halogen-flash-server - 约50t/s解码和1200t/s预填充 - 90%理论性能 - 仅针对Strix Halo和Qwen 3.8 Flash Next (Q38FN - Strix Halo的最佳首选模型)优化,如果你听说过Ninfer,这正是Strix Halo版的Ninfer。
https://github.com/myhacsint/llama.cpp/tree/production/strix-halo-qwen4exp-b10685 - 近60t/s解码和600t/s预填充 - 80%理论性能 - 这是针对Q38FN的实验分支,具有非常高的解码速度和相当不错的预填充性能。
https://github.com/halo-box/strix-llama.cpp - 近30t/s解码和800t/s预填充 - 75%理论性能 - 最新提交大幅提升了预填充性能,这是r/StrixHalo首个持续更新的fork,拥有一个活跃的Discord服务器和大量用户。
注意:官方llama.cpp运行Qwen38FN时解码速度为2xt/s,预填充速度为2xxt/s - 50%理论性能。
希望这对Strix Halo用户有所帮助。
相似文章
Strix Halo 用户:一个被拒绝的 PR 可使 MOE 的 PP 速度提升高达 30%。
一个针对 llama.cpp 的被拒绝的 PR 可在 AMD Strix Halo 硬件上为 MOE 模型提供高达 30% 的提示处理速度提升,但增益会随上下文长度增加而递减。
Strix Halo上的llama.cpp多令牌预测(MTP)基准测试:27B模型大幅提速,35B模型表现不一
在Strix Halo上对llama.cpp中的多令牌预测(MTP)进行的基准测试显示,长上下文聊天场景下27B Qwen模型显著加速,而35B模型则表现不一。
借助R9700实现Strix Halo双倍性能提升
一位用户分享了如何通过将大型MoE模型分配到Strix Halo APU和R9700 GPU之间,实现AI推理性能翻倍,详细介绍了配置和代码修改。
HIPfire 是否值得用于 Strix Halo?
本文征求社区对 HIPfire 在 AMD Strix Halo 硬件上的性能和质量评估,特别是与 llama.cpp 相比的长上下文支持情况。
Strix Halo ROCm + MTP 笔记 (2026年5月)
技术基准测试,比较 ROCm 和 Vulkan 后端在 Strix Halo 硬件上运行 LLM 推理的性能,MTP 合并到 llama.cpp 之后,结果显示 ROCm 在全上下文时性能严重下降,而 Vulkan 保持稳定。