GLM 5.2 on Dual Strix Halo (256GB): Worth it?
摘要
本文评测了在双Strix Halo(256GB显存)上运行GLM 5.2(IQ2M量化版本)的性能,生成速度仅约7 token/s,编码任务耗时是DeepSeek V4 Flash的两倍,性价比远不如其他模型,因此不建议在此硬件配置下使用。
暂无内容
查看缓存全文
缓存时间: 2026/06/25 09:10
### TL;DR
在双 Strix Sale(256GB 总显存)上运行 GLM 5.2 虽然可行,但速度极慢(生成约 7 token/s),编码任务耗时是 DeepSeek V4 Flash 的两倍,性价比远不如 DeepSeek V4 Flash 或 MiniMax M2.7 的量化版本。
---
## 为什么关注 GLM 5.2?
根据基准测试,GLM 5.2(7440 亿参数,400 亿激活)是目前最优秀的开源权重模型之一,常被拿来与 GPT‑5.5 和 Opus 比较。但问题在于:我们能否在本地硬件上跑它?需要什么配置?量化版本怎么选?划算吗?
这里的“我们”指拥有 1–2 块 128GB Strix Sale 芯片(如 GX Spark)或 128GB/256GB Mac Studio 的用户。
此前视频中测试的 DeepSeek V4 Flash(2840 亿参数,130 亿激活)在单 Strix Solo 上跑 Q2 量化版本表现良好:提示处理 >200 token/s(小上下文),64K 上下文时仍有 140 token/s;双设备跑 Q4 量化版提示处理约 60 token/s,生成约 12–13 token/s。
---
## GLM 5.2 的硬件需求
GLM 5.2 参数总量远超 DeepSeek V4 Flash,任何量化版本都无法在单块 128GB 设备上运行。至少需要两块 128GB 显存(共 256GB)。
作者使用 unslaught 的动态量化,推荐 IQ2M 量化版本(需要 239GB 显存)。注意,这里的 2‑bit 量化与 DeepSeek V4 的 2‑bit 不同:IQ2M 中很多权重实际用 8-bit 存储(注意力投影、专家网络等甚至用到 16-bit),因此精度保持得更好。
---
## 性能基准测试
在双 Strix Sale(llama.cpp RPC 分布式)上,IQ2M 量化版本的 GLM 5.2 性能如下:
- **提示处理**:小上下文时约 67 token/s,32K 上下文时降至 32 token/s,64K 上下文时预计更慢(测试未跑完)。
- **生成速度**:运行中约 7 token/s(实际交互测试)。
- **稳定性**:llama.cpp 的分布式推理在长上下文下容易崩溃(OOM),不如 DS4 引擎稳定。
建议:若需大上下文,应启用 KV 缓存量化(至少 Q8 以保持质量)。
---
## SWE‑bench 编码任务对比
作者在 SWE‑bench verified mini(45 个任务)上比较了 GLM 5.2 与 DeepSeek V4 Flash:
| 模型 | 平均完成时间 | 准确率 |
|-------------------|--------------|--------|
| DeepSeek V4 Flash | 21 分钟 | 约 90% |
| GLM 5.2 (IQ2M) | 约 42 分钟 | 约 90% |
两个模型输出质量相似(接近饱和),但 GLM 5.2 耗时翻倍。在其他非编码任务上,GLM 5.2 可能更强,但 IQ2M 量化版本是否能超过 DeepSeek V4 尚不清楚。
---
## 如何部署:双 Strix Solo 运行指南
使用作者的 llama.cpp toolbox(GitHub 仓库),通过 `distributed_llama` 脚本启动:
1. 在头节点下载 IQ2M 量化 GGUF(239GB)。
2. 进入 `scripts` 目录,运行 `run_distributed_llama`。
3. 指定 GGUF 文件夹、toolbox(需在远程机器上可用)、远程服务器 IP(如 192.168.100.1,SSH 连接)。
4. 选择 “Llama server”,设置上下文大小(最大 124K),推荐启用 KV 缓存量化(Q8)。
5. 额外参数添加 `reasoning_effort high`(不建议 `max`,否则更慢)。
6. 启动后服务监听 8080 端口,可通过 localhost 访问模型 API。
实际测试中,加载模型需要同步权重,之后生成速度约 7 token/s。虽然慢,但确实能工作。例如在 VS Code 中通过“PI Agent”调用,模型能正确理解项目和代码结构,输出质量优秀。
---
## 结论
对于拥有双 Strix Sale(256GB)的用户,**不建议**跑 GLM 5.2(IQ2M 量化)。
更好的选择是:
- **DeepSeek V4 Flash**(Q4 量化):速度更快,编码任务质量相当。
- **MiniMax M2.7**(VLM 工具箱中的量化版本):也明显优于 GLM 5.2。
除非你有极复杂任务必须由 GLM 5.2 完成,且不介意等待数倍时间,否则当前硬件上跑它并不划算。
作者欢迎观众在评论中提出特定任务,他可以远程测试 GLM 5.2 是否在这些任务中展现出独特价值。
---
**Source**: [GLM 5.2 on Dual Strix Halo (256GB): Worth it? – YouTube](https://youtu.be/PkKXm_mKCCM)
相似文章
消费级硬件上的 GLM 5.2
一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。
你在 Strix Halo 128GB 上运行的最佳模型是什么?
作者分享了在配备 Strix Halo 和 128GB 统一内存的 Framework 台式机上运行本地 AI 模型的经验,偏好使用 Qwen 模型进行编码,并寻求关于如何更好利用硬件的建议。
GLM 5.3 Flash (Ox Alpha) 基准测试对比
文章讨论了 GLM-5.3-Flash 模型的基准测试对比,重点介绍了其前沿智能和成本效率,该内容来自发布博客文章。
GLM 5.3 Flash Q4 在 M3 Ultra 上达到 60 token/秒 / 550 token/秒
GLM 5.3 Flash 在 Apple M3 Ultra 上的优化通过内核融合和高效内存使用,实现了最高 550 token/秒的预填充速度和 38 token/秒的推理速度,且无质量损失。
@aliez_ren: 这下真的舒服了,本地 70 tps 跑 GLM 5.2 几乎满血版! https://huggingface.co/madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid…
通过混合精度(MXFP8、NVFP4、NF3)量化,在4张96GB GPU上本地运行GLM-5.2(753B参数)几乎满血版,精度接近原始FP8,吞吐量达到70 tps。