GLM 5.2 在 Mac Studio 上的提速 PR

Reddit r/LocalLLaMA 模型

摘要

GLM 5.2 在配备 512GB RAM 的 Mac Studio 上带来了重大性能提升,在高上下文长度下实现超过 100 t/s 的预填充速度,并支持超过 10 万 token 上下文的 4 位量化,详细信息见 oMLX 创建者的拉取请求。

给那些幸运的 512GB Mac 用户提个醒:GLM 5.2 是一个颠覆性的变化,因为预填充速度在更高的上下文下仍保持在 100 t/s 以上,而且占用更少空间,因此我们可以运行超过 10 万上下文的 4 位量化。详见 oMLX 创建者的这个 PR:https://github.com/jundot/omlx/pull/1984
查看原文

相似文章

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。