GLM 5.2: 使用不到一半的令牌即可达到最高级别智能的98%

Reddit r/LocalLLaMA 模型

摘要

GLM 5.2 提供了改进的令牌效率,让用户能够使用不到一半的令牌即可达到最高级别智能的98%。与资源密集型的‘最高’级别相比,模型的‘高’努力级别为日常使用提供了一个实用的替代方案。

根据这些数据,GLM 5.1到GLM 5.2的推理令牌数量从16.7k翻倍到36.7k,对我这样一个使用老旧垃圾Xeon配置的本地用户来说,这导致GLM 5.2几乎无法使用——我在等待它回答我的数学问题12小时后不得不关闭模型。但随后我看到了z_ai技术报告中的这张图,它基本上表明,在高努力级别下,你可以使用不到最高努力级别一半的令牌,仍然能获得最高级别智能的大约98%,至少在编码任务中如此。因此我鼓励本地和API用户都尝试高努力级别,因为默认情况下GLM 5.2设置为最高级别。更新:终于,在高努力级别下使用Q4量化,经过6k令牌后,我得到了数学问题的答案。答案还行,但只有一半正确。作为对比,在z.ai聊天中使用最高级别得到的答案要好一些。我不知道,也许是Q4量化加高努力级别已经过度了。见更新2。更新2:我还在z.ai聊天中用‘高’努力级别运行了相同的提示,现在重新考虑所有3个答案,我认为它们非常相似。唯一的区别是,在‘最高’级别下,它明确提到了第二种情况,但随后又否定了它,尽管它不应该。另外两个回答从一开始就否定了它。所以差异更多在于同一个部分正确结果的呈现方式,而不是结果本身。请谨慎对待这些结果,因为每个运行条件只有一次尝试,但看起来‘高’努力级别是日常使用的更好选择,而‘最高’级别则在你绝对需要完美结果或者想让你的模型在基准测试中表现更好时使用)) https://preview.redd.it/eha9j6vd9e8h1.png?width=6166&format=png&auto=webp&s=204c3261fada0c3eac8e4ab52fed7b45c1831b7b
查看原文

相似文章

GLM-5.2: 专为长程任务打造

Hugging Face Blog

Z.AI推出GLM-5.2,这是一款专为长程任务设计的旗舰模型,拥有稳定的100万token上下文、改进的编码能力以及MIT开源许可证,在与Opus 4.8和GPT-5.5等领先模型的对比中展现了竞争力。

GLM-5.2 是本地人工智能的一次胜利

Reddit r/LocalLLaMA

GLM-5.2 是一款拥有 753B 参数、采用 MIT 许可证的开源模型,具备前沿级别的编码能力和超大的上下文窗口。其蒸馏潜力有望为本地 AI 设置带来显著改进。

GLM-5.2 可能是目前最强大的纯文本开放权重大语言模型

Simon Willison's Blog

中国AI实验室Z.ai发布了GLM-5.2,这是一个拥有7530亿参数的开放权重大语言模型,支持100万token的上下文窗口,采用MIT许可证。该模型在Artificial Analysis Intelligence Index上获得最高分,并在Code Arena WebDev排行榜上排名第二。

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。