@wafer_ai: 突发:这些工程师成功在 @AMD MI355X 上以每节点 2626 tok/s 和单流 213 tok/s 的速度运行 GLM 5.2
摘要
工程师成功在 AMD MI355X 上部署 GLM 5.2,达到每节点 2626 tok/s 和单流 213 tok/s 的性能,相当于 B200 吞吐量的约 80%,而成本不到 Blackwell 的一半。
查看缓存全文
缓存时间: 2026/07/04 08:41
🚨 突发消息:
这些工程师找到了如何在 @AMD MI355X 上部署 GLM 5.2 的方法,单节点吞吐量达 2626 tok/s,单流延迟 213 tok/s,成本不到 Blackwell 的一半
这大约是 B200 吞吐量的 80%,成本却只有一半以下
详情见回帖:https://t.co/1wAickkQEm
突发消息:
这些工程师找到了如何在 @AMD MI355X 上部署 GLM 5.2 的方法,单节点吞吐量达 2626 tok/s,单流延迟 213 tok/s,成本不到 Blackwell 的一半
这大约是 B200 吞吐量的 80%,成本却只有一半以下
详情见回帖
他们是这样做到的:
喂,你们说的那是我爸
哈哈哈
没你酷啦 @tomgreenwald
谢谢!
谢谢!
我们总是准时
相似文章
性价比不断提升,成本不断降低
Wafer 证实,AMD MI355X GPU 在推理前沿模型(如 GLM5.2)时,提供了有竞争力的性能,且成本远低于 NVIDIA Blackwell,使用 MXFP4 量化和 sglang 框架,以不到一半的价格实现了 B200 80% 的吞吐量。
@wafer_ai:突发新闻 我们又上 Hacker News 了 我们找到了如何在……上以 3.8 倍吞吐量和 71% 更低成本服务 Kimi K3
Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。
16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
我进行了一些模型优化技巧,将GH200系统上的GLM5.2从约2.5 tok/s提升至超过50 tok/s。
一篇详细博客文章,描述了如何通过停止模型跨模块通信,并将FP8 MTP头部嫁接至INT4基础模型上,将双Grace Hopper系统上的GLM-5.2推理速度从2.5 tok/s显著提升到超过50 tok/s。
LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行
LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。