用于AMD MI350X的Qwen3.6-35B-A3B开源内核:在8块GPU上实现78,498输出tok/s

Reddit r/LocalLLaMA 工具

摘要

本文介绍了为在AMD MI350X GPU上运行Qwen3.6-35B-A3B大语言模型所做的优化,实现了高输出令牌吞吐量,并开源了内核以提升性能。

实际上,几乎所有人都使用NVIDIA来运行他们的LLM,我们也一样。我们遇到的很多人使用像RTX PRO 6000甚至H100、B300这样的GPU。似乎所有人的目光都集中在NVIDIA上。然而,我们计算了一下,AMD GPU MI350X的原始性能就高于NVIDIA B200。问题出在哪里?显然是软件,ROCM不如CUDA成熟,他们的软件栈仍然落后。但是,几周前我们拿到一些MI350X进行实验和开发,我们所做的就是将AMD技术栈优化到内核级别,针对Qwen 3.6 35B A3B,得到的结果与NVIDIA对应产品相当。根据我们的基准测试,我们得到:1x MI350X: 11,161输出tok/s,8x MI350X: 81,331输出tok/s峰值,平均78,498.66输出tok/s。这是8-GPU基准测试中vLLM吞吐量的2.16倍。我们决定在我们的GitHub上开源我们的内核和其他东西:https://github.com/NetraRuntime/netra-kernel,并撰写了一篇关于我们所做工作的博客:https://netraruntime.com/blog/qwen36-amd-mi350x-sglang-vllm-benchmark。然而,我们还没有完成。我们学到的一点是:一旦内核足够快,瓶颈就会转移到调度、图覆盖、循环状态、路由,甚至HTTP序列化。
查看原文

相似文章