标签
Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。
一位用户声称,开源模型 GLM 5.2 在 Claude Code 中的编码任务表现优于 Opus 4.8,并表达了难以置信。
GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。
比较了从 GLM 5.1 到 5.2 和从 Qwen 3.5 到 3.6 的改进,讨论哪个更新更令人印象深刻。
一项新的代理基准测试已发布,Claude Fable 和 GLM 5.2 在各自类别中名列前茅。
用户报告在 Mac Studio 上本地运行 GLM 5.2(2比特量化),声称其性能优于 Opus 4.8,并实现免费、私密的超级智能,用于编程和智能体任务。
IndexShare是GLM-5.2报告中提到的一种技术,它在稀疏注意力中跨多个层共享一个索引器,通过避免每层重复选择top-k,在1M上下文长度下将FLOPs降低了2.9倍。
unsloth 已将 GLM-5.2 的 GGUF 版本上传至 Hugging Face,为 llama.cpp、vLLM 和 SGLang 等多种推理引擎提供了可直接使用的模型文件。
用户询问在四个 Ascend GX10 或 DGX Sparks 上以 4 位量化运行 GLM-5.2 的可行性,想知道在 100k 上下文下的速度和内存情况。
关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。
GLM-5.2, 一款用于长程任务的新型旗舰模型,支持100万token上下文,权重已开源。
基于GLM 5.2的基准测试数据,预测开源AI模型将在两个月内与假想的Fable 5达到同等水平。
ClawCodex(一款开源的Claude Code Python重构版)现已将Z.ai的GLM-5.2作为一级提供商支持,并附带演示:一次调用便构建出FIFA World Cup 2026介绍页面。
GLM-5.2 已以 MIT 许可证发布开放权重,拥有 100 万上下文窗口和两种推理努力模式。早期基准测试显示它在编程任务中表现出色,值得在基准截图之外进行测试。
GLM5.2 重新引入了一个评判器组件,用于细粒度的方差缩减,这表明基于组的方法在长视界下是无效的。作者认为 OpenAI 和 Anthropic 已经在使用价值模型。