在本地运行GLM 5.x的最便宜方式(不使用统一内存系统)?
摘要
关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。
这主要是一个探索可能选项的练习,尽管可能比较冷门,目标是至少运行4位量化(比如大概IQ4_XS)。
1. 有仅CPU的配置吗?请分享你的经验。Sapphire Rapids ES 56核 + DDR5可能是一个选项。
2. 多GPU配置,部分或完全卸载?你的性能如何?
3. 不仅限于GLM 5.x,任何类似大小的模型在这个讨论范围内都可以。
个人而言,我使用的是5900X + 128GB DDR4 + 7900XT 20GB。我能运行的最大模型是来自AesSedAI的Minimax 2.7,采用Q4_K_S量化 - [https://huggingface.co/AesSedai/MiniMax-M2.7-GGUF](https://huggingface.co/AesSedai/MiniMax-M2.7-GGUF)
对于更小的模型,仍然是来自Unsloth/Bartowski的Qwen 3.6 27B,采用IQ4_XS量化。
相似文章
在仅有CPU的情况下本地运行GLM-5.2!(穷人的大型模型方案)
一位用户仅用CPU在本地运行GLM-5.2,演示如何在简陋的配置上运行大型模型。
在预算低于2500美元的硬件上运行GLM5.2。
一份指南,展示如何使用二手服务器组件构建一套成本低于2500美元的系统,以便本地运行GLM5.2及其他大型AI模型,代价是速度会有所妥协。
以合理量化运行GLM2的方案构想,求批评与反馈
一位用户提出使用四块RTX 5060 Ti GPU和512GB DDR3服务器内存的硬件配置,以合理的量化方式运行GLM2,并就此方案的可行性寻求反馈。
Colibri 实操体验:本地无 GPU 运行 GLM 5.2 (744B)
Colibri 支持在 CPU 上本地运行 744B 参数的 GLM 5.2 模型,无需 GPU 硬件即可实现大规模 AI 的访问。
消费级硬件上的 GLM 5.2
一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。