在本地运行GLM 5.x的最便宜方式(不使用统一内存系统)?

Reddit r/LocalLLaMA 新闻

摘要

关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。

这主要是一个探索可能选项的练习,尽管可能比较冷门,目标是至少运行4位量化(比如大概IQ4_XS)。 1. 有仅CPU的配置吗?请分享你的经验。Sapphire Rapids ES 56核 + DDR5可能是一个选项。 2. 多GPU配置,部分或完全卸载?你的性能如何? 3. 不仅限于GLM 5.x,任何类似大小的模型在这个讨论范围内都可以。 个人而言,我使用的是5900X + 128GB DDR4 + 7900XT 20GB。我能运行的最大模型是来自AesSedAI的Minimax 2.7,采用Q4_K_S量化 - [https://huggingface.co/AesSedai/MiniMax-M2.7-GGUF](https://huggingface.co/AesSedai/MiniMax-M2.7-GGUF) 对于更小的模型,仍然是来自Unsloth/Bartowski的Qwen 3.6 27B,采用IQ4_XS量化。
查看原文

相似文章

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。