针对Strix Halo - 官方llama.cpp并非理想选择及如何实现最高吞吐量

Reddit r/LocalLLaMA 工具

摘要

本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。

我一直在就Strix Halo (gfx1150) 的最佳设置发表许多评论,根据我的观察,我们社区中有90%的人在使用官方llama.cpp,但它并未针对Strix Halo进行优化,官方llama.cpp极难达到硬件理论性能的50%,浪费了该设备的硅芯片资源。以下是能将Strix Halo的速度提升至全新境界的替代方案,我将链接用户满意评论以证明结果真实: https://github.com/peonist-ai/halogen-flash-server - 约50t/s解码和1200t/s预填充 - 90%理论性能 - 仅针对Strix Halo和Qwen 3.8 Flash Next (Q38FN - Strix Halo的最佳首选模型)优化,如果你听说过Ninfer,这正是Strix Halo版的Ninfer。 https://github.com/myhacsint/llama.cpp/tree/production/strix-halo-qwen4exp-b10685 - 近60t/s解码和600t/s预填充 - 80%理论性能 - 这是针对Q38FN的实验分支,具有非常高的解码速度和相当不错的预填充性能。 https://github.com/halo-box/strix-llama.cpp - 近30t/s解码和800t/s预填充 - 75%理论性能 - 最新提交大幅提升了预填充性能,这是r/StrixHalo首个持续更新的fork,拥有一个活跃的Discord服务器和大量用户。 注意:官方llama.cpp运行Qwen38FN时解码速度为2xt/s,预填充速度为2xxt/s - 50%理论性能。 希望这对Strix Halo用户有所帮助。
查看原文

相似文章

借助R9700实现Strix Halo双倍性能提升

Reddit r/LocalLLaMA

一位用户分享了如何通过将大型MoE模型分配到Strix Halo APU和R9700 GPU之间,实现AI推理性能翻倍,详细介绍了配置和代码修改。

HIPfire 是否值得用于 Strix Halo?

Reddit r/LocalLLaMA

本文征求社区对 HIPfire 在 AMD Strix Halo 硬件上的性能和质量评估,特别是与 llama.cpp 相比的长上下文支持情况。

Strix Halo ROCm + MTP 笔记 (2026年5月)

Reddit r/LocalLLaMA

技术基准测试,比较 ROCm 和 Vulkan 后端在 Strix Halo 硬件上运行 LLM 推理的性能,MTP 合并到 llama.cpp 之后,结果显示 ROCm 在全上下文时性能严重下降,而 Vulkan 保持稳定。