仅CPU的GLM 5.2:Epyc与512GB内存
摘要
GLM 5.2 针对在搭载512GB内存的AMD Epyc处理器上进行纯CPU推理进行了优化。
暂无内容
相似文章
在仅有CPU的情况下本地运行GLM-5.2!(穷人的大型模型方案)
一位用户仅用CPU在本地运行GLM-5.2,演示如何在简陋的配置上运行大型模型。
@ErickSky: 忘掉vLLM、llama.cpp和昂贵的GPU吧。[colibri] 这个工具用纯C语言在约25GB RAM上运行GLM-5.2 (744B MoE)…
colibri 是一个纯C语言推理工具,通过从磁盘流式传输专家模型,在约25GB RAM上运行GLM-5.2 744B MoE模型,无需昂贵的GPU。
GLM5.2 @7tg 在预算主板+CPU上使用4x3090+192GB
在预算配置下,使用4块RTX 3090 GPU和192GB内存运行GLM5.2,处理7万亿tokens。
Show HN: 在慢速电脑上运行GLM 5.2
Colibrì是一个纯C推理引擎,通过从磁盘流式加载专家,在约25GB RAM的消费级硬件上运行744B参数的GLM-5.2 MoE模型,配合推测解码可实现约2.2-2.8 token/秒的速度。
在本地运行GLM 5.x的最便宜方式(不使用统一内存系统)?
关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。