@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash
摘要
一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。
在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,128 GiB 统一内存)发布了 DFlash + PFlash。Qwen3.6-27B Q4_K_M,在同一芯片上端到端运行:▸ 解码:26.85 tok/s,快 2.23 倍(DFlash + DDTree,预算 22)▸ Prefill 16K:20.2s,快 3.05 倍(PFlash)▸ 实际耗时,16K 提示词 + 1K 生成:58s vs 147s 设备中仍有 ~100 GiB 空闲。接下来将支持 122B 和 139B MoE 级别模型。衷心感谢 @smpurkis0 的贡献
相似文章
@pupposandro: https://x.com/pupposandro/status/2054241934164492328
该文章宣布了 llama.cpp 对 AMD Strix Halo 集成 GPU (iGPU) 上的 DFlash 和 PFlash 投机解码的支持,并展示了使用 ROCm 时推理性能的显著提升。
AMD Strix Halo 上的 Luce DFlash + PFlash:Qwen3.6-27B 解码速度提升 2.23 倍,预填充速度提升 3.05 倍(相较于 llama.cpp HIP)
Luce 为 AMD Strix Halo APU 发布了 DFlash 和 PFlash 支持,在 Qwen3.6-27B 模型上,其解码和预填充速度相比 llama.cpp HIP 分别提升了 2.23 倍和 3.05 倍。
如果您在Strix Halo上运行Qwen 3.8 Flash Next,请使用此软件进行推理。它比llama.cpp快得多,尤其是在高上下文情况下。
一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。
我在llama.cpp中测试了最新合并的DFlash在Qwen 3.6 27B本地AI上的表现。36K上下文速度提升4.44倍。以下是我的发现(RTX 6000 PRO)。
一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。
@pupposandro: 兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,...
Lucebox 引擎现在支持在单张 AMD Radeon AI PRO R9700 GPU 上运行 Qwen3.8-27B 模型,使用 DFlash2 drafter 进行无损验证,在代码任务上最高可达 227 tok/s。