标签
本文详细介绍了在4台GB10的配置上,使用100G交换机运行GLM 5.2,在330k上下文下实现约25 tok/s解码和约650 tok/s预填充。内容包括硬件成本、使用Depth Prefill的性能基准测试,以及关于为更长上下文进行模型剪枝的说明。
Theo 称赞 GLM 5.2 是一个令人难以置信的模型,但批评了认为它可以自托管且与 Fable 相提并论的看法,引发了关于模型可访问性的讨论。
来自Z.ai的GLM 5.2作为一款强大的开源权重模型,与Opus、GPT等前沿模型竞争,但真正的故事是随着成本降低和竞争加剧,人工智能推理领域即将到来的利润率崩塌。
Ahmad Osman 强调了腾讯Hy3相对于预览版的改进,并将其与体积大两倍的GLM 5.2进行了比较,同时分享了一个关于在RTX 5090上运行类似智能的预测。
在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。
中国开源模型GLM 5.2以低成本达到与美国顶尖AI模型相当的性能,正在冲击美国AI公司的高价垄断模式,导致硅谷AI泡沫面临破裂风险。
工程师成功在 AMD MI355X 上部署 GLM 5.2,达到每节点 2626 tok/s 和单流 213 tok/s 的性能,相当于 B200 吞吐量的约 80%,而成本不到 Blackwell 的一半。
Ahmad Osman 预测,在18个月内,像 RTX 5090 这样的GPU将能够承载相当于 GLM 5.2 的智能。
GLM-5.2 现在可以通过 Hugging Face Inference Providers 和 hf-claude 在 Claude Code 中选择使用,使得将开源模型集成到开发者工作流中变得更加容易。
Z.ai 推出 ZCode,这是为其 GLM-5.2 模型打造的代理式开发环境,凭借深度集成、多设备支持和有竞争力的定价,挑战现有的 AI 编程工具。
GLM 5.2,一个开放前沿规模的 AI 模型,现已可在 Microsoft Foundry 上使用 AMD MI300X 硬件,从而实现高效的 Codex 目标执行。
一位用户分享了对GLM-5.2模型的正面印象,指出其相比Deepseek性能出色且成本效益更高,并反思了AI代理在编程和学习中的教育价值及其局限性。
GLM 5.2 展示了其端到端构建可运行 CV(简历)应用的能力,展现了 AI 辅助开发的成果。
本文通过在一个复杂的多文件计算机视觉实现任务上测试,评估 GLM 5.2 是否适合生产环境使用。
据传闻,zAI 的某个新模型在网络安全能力上至少与 Fable 5 一样强,但信息有限,仅引用了讨论 GLM 5.2 的华尔街日报文章。
智谱AI的开权重模型GLM 5.2在IDOR检测基准测试中以远低于Claude Code的成本击败了它,尽管仍落后于Semgrep专门构建的多模态管道。文章探讨了漏洞检测性能有多少来自模型本身,又有多少来自其周围的工具链。
NVIDIA 发布了 GLM-5.2 的 NVFP4 量化检查点,这是一个 744B MoE 模型(40B 激活),针对推理和编码进行了优化,并在 SGLang 中提供 Day-0 支持。
一条推文讨论了GLM 5.2如何揭示企业向本地计算和后训练模型发展的趋势,以及对开源AI未来的不同看法。
Fireworks 正在提供一种针对 GLM 5.2 的强化学习训练的托管服务,该服务通过批次不变性和零 KLD 对齐确保训练和推理之间的数值一致性,以前只有顶尖前沿实验室才能使用。这使得任何人都可以定制并超越前沿质量。