GLM 5.2 在 4 个 Sparks 上运行是否合理?

Reddit r/LocalLLaMA 新闻

摘要

用户询问在四个 Ascend GX10 或 DGX Sparks 上以 4 位量化运行 GLM-5.2 的可行性,想知道在 100k 上下文下的速度和内存情况。

GLM-5.2 显然是一个非常优秀的模型,我想知道它在四个 Ascend GX10 / DGX Sparks 上的运行速度如何。网上完全找不到相关数据。难道不能在 4*128=512GB 的统一内存上运行 4 位量化吗?例如在 100k 上下文下,提示处理和输出 token/秒会是多少?
查看原文

相似文章

考虑入手4块Ascend GX10

Reddit r/LocalLLaMA

一位用户考虑购买四块Ascend GX10来运行GLM5.2,提到性能数据:提示处理400-500 tok/s,128k上下文下输出约15 tok/s,并计划用于未来的开源模型。