@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash

X AI KOLs Following 工具

摘要

一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。

在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,128 GiB 统一内存)发布了 DFlash + PFlash。Qwen3.6-27B Q4_K_M,在同一芯片上端到端运行:▸ 解码:26.85 tok/s,快 2.23 倍(DFlash + DDTree,预算 22)▸ Prefill 16K:20.2s,快 3.05 倍(PFlash)▸ 实际耗时,16K 提示词 + 1K 生成:58s vs 147s 设备中仍有 ~100 GiB 空闲。接下来将支持 122B 和 139B MoE 级别模型。衷心感谢 @smpurkis0 的贡献
查看原文

相似文章