@10xmylife: Unsloth 成功将 2-bit 版本的 GLM-5.2 部署在了 256GB 的 Mac 上
摘要
Unsloth 成功将 GLM-5.2 模型以 2-bit 量化压缩至 238GB,可在 256GB Mac 上本地运行,保留约 82% 的准确率。
查看缓存全文
缓存时间: 2026/06/20 16:18
Unsloth 成功将 2-bit 版本的 GLM-5.2 部署在了 256GB 的 Mac 上
Unsloth AI (@UnslothAI): GLM-5.2 现在可以在本地运行了!🔥
我们将其从 1.51TB 压缩至 238GB(体积缩小 84%)后,2-bit 模型仍保留了约 82% 的准确率。
可部署在 256GB Mac 或其他内存/显存组合的硬件上。
GLM-5.2 是迄今为止最强的开源模型。
指南:https://t.co/bI7FeeKHDd GGUF:
相似文章
@cryptoresetlife: @support_huihui 在 Mac Studio M3 Ultra (512GB) 上成功部署无审查版 GLM5.2 754B 参数模型 (231GB GGUF),948 tokens / 4分25秒 ≈ 3.6 tokens/s
无审查版 GLM5.2 754B 参数模型(231GB GGUF)已成功部署在配备512GB内存的 Mac Studio M3 Ultra 上,实现了约3.6 tokens/s的速度。
@UnslothAI: GLM-5.2 现在可以本地运行!2-bit 模型在从 1.51TB 缩小到 238GB(-84% 大小)后保留了约 82% 的准确率…
UnslothAI 宣布 GLM-5.2,Z.ai 的最强开源模型,拥有 744B 参数,现在可以通过动态 GGUF 量化在本地运行,将大小减少约 84% 至 239GB,同时保留约 82% 的准确率。它适用于 256GB Mac 以及 RAM/VRAM 配置,并支持长上下文、推理和代理任务。
@nicebabycat: https://x.com/nicebabycat/status/2091726637155103126
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
@AlexFinn:我简直不敢相信这是真的,我的 Mac Studio 上 100% 本地运行 GLM 5.2(2比特量化),得到的结果……
用户报告在 Mac Studio 上本地运行 GLM 5.2(2比特量化),声称其性能优于 Opus 4.8,并实现免费、私密的超级智能,用于编程和智能体任务。
@aliez_ren: 这下真的舒服了,本地 70 tps 跑 GLM 5.2 几乎满血版! https://huggingface.co/madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid…
通过混合精度(MXFP8、NVFP4、NF3)量化,在4张96GB GPU上本地运行GLM-5.2(753B参数)几乎满血版,精度接近原始FP8,吞吐量达到70 tps。