bitsandbytes 创造者预告新量化方法:单块 DGX Spark 上运行 GLM 5.3,速度 7 tokens/s
摘要
bitsandbytes 的创造者 Tim Dettmers 正在预告一种新的量化方法,据报道该方法可以在单块 DGX Spark 上以 7 tokens/s 的速度运行 GLM 5.3,社区对此持谨慎乐观态度。
别太激动 + 保持怀疑,因为已经有无数量化方案承诺得很好,但从未真正实现。不过 Tim Dettmers 是一位相当知名的研究者,所以也许这次会有所成果。时间会证明一切。关于该方法的另一条推文:单块 B300(288 GB VRAM)上的 DS4 Pro:https://xcancel.com/Tim_Dettmers/status/2087624491362820364
相似文章
在4台DGX Spark上运行4-bit量化GLM-5.2(753B MoE):Terminal-Bench 2.1得分70.8%,完整模型为81.0%
在4台DGX Spark机器上运行4-bit量化版GLM-5.2(753B MoE),Terminal-Bench 2.1得分为70.8%,而完整模型为81.0%。
@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s
关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。
GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码
描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。
@TheAhmadOsman: Luke Alonso 已上传了一个 NVFP4 量化版本的 GLM 5.2,大小为 467GB,可适配 4 块 DGX Sparks(约 2 万美元)
Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。
GLM 5.2 在 4 个 Sparks 上运行是否合理?
用户询问在四个 Ascend GX10 或 DGX Sparks 上以 4 位量化运行 GLM-5.2 的可行性,想知道在 100k 上下文下的速度和内存情况。