GLM5.2 @7tg 在预算主板+CPU上使用4x3090+192GB
摘要
在预算配置下,使用4块RTX 3090 GPU和192GB内存运行GLM5.2,处理7万亿tokens。
暂无内容
相似文章
GLM5.2 在 5 块 Pro 6000 和一块 5090 上的昂贵旅程
一篇关于在 5 块 AMD Radeon Pro 6000 GPU 和一块 NVIDIA RTX 5090 上运行 GLM5.2 语言模型的报告,详细介绍了高昂的成本和技术挑战。
消费级硬件上的 GLM 5.2
一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。
@0xSero:GLM-5.1-478B-NVFP4 跑在:4×RTX Pro 6000、SGLang,最大 37 万 token(1.75× 满上下文),p10 27.7 | p90 45…
一份 478B 参数的量化 GLM-5.1 模型在 4 块 RTX Pro 6000 上用 SGLang 运行,支持 37 万 token 上下文,解码最高 45 tok/s,预填充 1340 tok/s,并现场演示操控 Figma。
@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。
@AlpinDale: GLM-5.2-FP8在4个节点的4090-48GB上运行,解码速度约28 tok/s。这些节点通过以太网的互连速度为10吉比特……
AlpinDale称,在4个节点的RTX 4090(48GB)上运行GLM-5.2-FP8,通过10吉比特以太网实现约28 tok/s的解码速度,并计划使用DSpark进行优化。