考虑入手4块Ascend GX10

Reddit r/LocalLLaMA 新闻

摘要

一位用户考虑购买四块Ascend GX10来运行GLM5.2,提到性能数据:提示处理400-500 tok/s,128k上下文下输出约15 tok/s,并计划用于未来的开源模型。

这个子版块里有人测试过GLM5.2在4x DGX Sparks(或Ascend GX10)上的表现:提示处理400-500 tok/s,128k上下文下输出约15 tok/s。虽然不是飞快,但我觉得可用,尤其是量化后。我的想法:如果今年12月或明年某个时候有开源的Fable 5,我宁愿硬件已经准备好,能以我能接受的速度运行它。1000W的功耗吓不倒我。有没有在用这套配置的人,想劝我放弃(或者劝我入手)?
查看原文

相似文章