消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA 模型

摘要

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。

我在仍然算“消费级”的硬件上尝试了 unsloth 量化的 GLM 5.2:32C Zen5 Threadripper Pro 9975 WX、Asus WRX90E-SAGE-SE PCIe Gen5、512GB DDR5 ECC RAM @ 4800MHz、双 RTX 5090。这台机器是在内存价格尚未疯涨之前组装的,当时与如今离谱的价格相比并不算太贵。我使用的量化版本是 unsloth/GLM-5.2-GGUF,UD-Q5_K_S(权重文件 492GB)。我使用最新编译的 llama.cpp,编译命令如下:cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES="120f" -DGGML_CUDA_FA_ALL_QUANTS=ON -DGGML_CUDA_FORCE_MMQ=ON -DGGML_SCHED_MAX_COPIES=1 -DGGML_CUDA_GRAPHS=ON -DGGML_CCACHE=OFF -DGGML_CUDA_ENABLE_UNIFIED_MEMORY=0; cmake --build build --config Release -j 64。运行命令如下:CUDA_VISIBLE_DEVICES=0,1 numactl --physcpubind=0-31 --localalloc llama.cpp/build/bin/llama-server \ --model ./GLM-5.2-UD-Q5_K_S-00001-of-00012.gguf \ --temp 1.0 \ --top-p 0.95 \ --min-p 0.01 \ --fit on --no-mmap --flash-attn on --ctx-size 32768 --no-warmup --prio 3 \ --threads 32 --threads-batch 32 --numa isolate --log-verbosity 4 --split-mode layer --direct-io --jinja。这样我获得了稳定的每秒 12 个 token。我只是尝试了聊天功能,没有使用代理功能。无论是否使用最后一行中的 llama.cpp 选项,速度几乎没有任何变化;numa 相关设置也是如此。
查看原文

相似文章

Show HN: 在慢速电脑上运行GLM 5.2

Hacker News Top

Colibrì是一个纯C推理引擎,通过从磁盘流式加载专家,在约25GB RAM的消费级硬件上运行744B参数的GLM-5.2 MoE模型,配合推测解码可实现约2.2-2.8 token/秒的速度。