@TheAhmadOsman: Luke Alonso 已上传了一个 NVFP4 量化版本的 GLM 5.2,大小为 467GB,可适配 4 块 DGX Sparks(约 2 万美元)
摘要
Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。
Luke Alonso 已上传了一个 NVFP4 量化版本的 GLM 5.2
大小 467GB,可适配 4 块 DGX Sparks(约 2 万美元)https://t.co/8wP1uUypLC
查看缓存全文
缓存时间: 2026/06/20 22:24
Luke Alonso 上传了 GLM 5.2 的 NVFP4 版本
467GB,可装进 4 块 DGX Sparks(约 2 万美元)https://t.co/8wP1uUypLC
相似文章
GLM 5.2 在 4 个 Sparks 上运行是否合理?
用户询问在四个 Ascend GX10 或 DGX Sparks 上以 4 位量化运行 GLM-5.2 的可行性,想知道在 100k 上下文下的速度和内存情况。
后续:在四块DGX Spark上运行GLM-5.2 NVFP4——MTP谜题已解,现可在128K上下文下达到约24 tok/s
修复了vLLM中为四块DGX Spark配置GLM-5.2 NVFP4时的一个推测解码bug,解决了性能权衡问题,通过MTP4在128K上下文下实现了约24 tok/s。
在4台DGX Spark上运行4-bit量化GLM-5.2(753B MoE):Terminal-Bench 2.1得分70.8%,完整模型为81.0%
在4台DGX Spark机器上运行4-bit量化版GLM-5.2(753B MoE),Terminal-Bench 2.1得分为70.8%,而完整模型为81.0%。
GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码
描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。
@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。