Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA 模型

摘要

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

vLLM ROCm/HiP,4 位压缩张量(int4)这不是一个公平的比较,但 Qwen-122b 在我运行过的最优格式(rocmFP4)下,速度也无法触及 Ling。https://x.com/ciruai/status/2085996633267777554?s=46 工具调用在某些测试框架中损坏。它能在 pi 型测试框架(omp、feynman)中正常工作。有人注意到这一点吗?
查看原文

相似文章