考虑入手4块Ascend GX10
摘要
一位用户考虑购买四块Ascend GX10来运行GLM5.2,提到性能数据:提示处理400-500 tok/s,128k上下文下输出约15 tok/s,并计划用于未来的开源模型。
这个子版块里有人测试过GLM5.2在4x DGX Sparks(或Ascend GX10)上的表现:提示处理400-500 tok/s,128k上下文下输出约15 tok/s。虽然不是飞快,但我觉得可用,尤其是量化后。我的想法:如果今年12月或明年某个时候有开源的Fable 5,我宁愿硬件已经准备好,能以我能接受的速度运行它。1000W的功耗吓不倒我。有没有在用这套配置的人,想劝我放弃(或者劝我入手)?
相似文章
GLM 5.2 在 4 个 Sparks 上运行是否合理?
用户询问在四个 Ascend GX10 或 DGX Sparks 上以 4 位量化运行 GLM-5.2 的可行性,想知道在 100k 上下文下的速度和内存情况。
在4台GB10上运行GLM 5.2,配备100G交换机,330k上下文,~25 tok/s解码,~650 tok/s预填充
本文详细介绍了在4台GB10的配置上,使用100G交换机运行GLM 5.2,在330k上下文下实现约25 tok/s解码和约650 tok/s预填充。内容包括硬件成本、使用Depth Prefill的性能基准测试,以及关于为更长上下文进行模型剪枝的说明。
我进行了一些模型优化技巧,将GH200系统上的GLM5.2从约2.5 tok/s提升至超过50 tok/s。
一篇详细博客文章,描述了如何通过停止模型跨模块通信,并将FP8 MTP头部嫁接至INT4基础模型上,将双Grace Hopper系统上的GLM-5.2推理速度从2.5 tok/s显著提升到超过50 tok/s。
@AlpinDale: GLM-5.2-FP8在4个节点的4090-48GB上运行,解码速度约28 tok/s。这些节点通过以太网的互连速度为10吉比特……
AlpinDale称,在4个节点的RTX 4090(48GB)上运行GLM-5.2-FP8,通过10吉比特以太网实现约28 tok/s的解码速度,并计划使用DSpark进行优化。
GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码
描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。