Ling 3.0 Flash 在 Strix Halo 上的表现
摘要
推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。
vLLM ROCm/HiP,4 位压缩张量(int4)这不是一个公平的比较,但 Qwen-122b 在我运行过的最优格式(rocmFP4)下,速度也无法触及 Ling。https://x.com/ciruai/status/2085996633267777554?s=46 工具调用在某些测试框架中损坏。它能在 pi 型测试框架(omp、feynman)中正常工作。有人注意到这一点吗?
相似文章
AMD Strix Halo 上的 Luce DFlash + PFlash:Qwen3.6-27B 解码速度提升 2.23 倍,预填充速度提升 3.05 倍(相较于 llama.cpp HIP)
Luce 为 AMD Strix Halo APU 发布了 DFlash 和 PFlash 支持,在 Qwen3.6-27B 模型上,其解码和预填充速度相比 llama.cpp HIP 分别提升了 2.23 倍和 3.05 倍。
Qwen3.8-Flash-Next + MTP 在 Strix Halo 上:Vulkan 运行时备注
在 Strix Halo 硬件上使用 llama.cpp 的 Vulkan 后端运行 Qwen3.8-Flash-Next 和 MTP 的基准测试结果,包括性能指标和对输出质量的观察。
如果您在Strix Halo上运行Qwen 3.8 Flash Next,请使用此软件进行推理。它比llama.cpp快得多,尤其是在高上下文情况下。
一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。
@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash
一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。
Ling-3.0-flash 是另一个在 qwen3.8 27b 之前值得测试的潜在模型
Ling-3.0-flash 是一个新模型,作者测试后发现它能修复 Qwen3.6-27b 无法修复的棘手软件错误,速度与 DeepSeek V4 flash 相近。其发布时间已推迟到 8 月 6 日。