@jpschroeder: 没有任何提供商提供原生 bf16 的 GLM-5.2。
摘要
一位用户指出,目前没有云服务提供商提供原生 bf16 精度的 GLM-5.2 模型,凸显了托管选项上的空白。
零家提供商提供原生 bf16 的 GLM-5.2。https://t.co/ibCRYKNODW
查看缓存全文
缓存时间: 2026/06/27 11:57
没有提供商提供原生 bf16 格式的 GLM-5.2。https://t.co/ibCRYKNODW
相似文章
@0xSero:我们找到了一种在 vLLM 中以完整上下文运行 GLM-5.2 且无需剪枝的方法。 - 前 32 个专家使用 NVFP4 - 其余使用 fp3 - intel auto…
一位社区研究员通过混合量化(NVFP4、NF3、MXFP8),在无需剪枝的情况下,在 vLLM 中运行了 GLM-5.2(753B 参数,全部 256 个专家),可在 4×96GB GPU 上运行,拥有约 307k KV 缓存,精度接近 FP8。
@tolak_eth: 我想分享一下我们是如何避免每年花费约16万美元来托管拥有完整1M上下文的GLM-5.2。当GLM-5.2推出时……
Phala通过将MoE专家量化至4位并保留关键部分为FP8/BF16,在单个8×H200节点上实现了与FP8基线相同的基准测试结果,从而避免了每年16万美元的GLM-5.2完整1M上下文托管成本,并在Hugging Face上发布了优化后的模型GLM-5.2-W4AFP8。
@jun_song: GPT-5.6 似乎非常令人失望。并不比 GLM-5.2 好。
一位用户表达了对GPT-5.6的失望,声称它并不比GLM-5.2好。
GLM-5.2 现已上线 DeepSWE
GLM-5.2 已在 DeepSWE 平台发布。
jlnsrk/GLM-5.2-colibri-int4
针对GLM-5.2 744B MoE模型的预转换int4量化权重,旨在使用colibrì引擎在约25GB内存的消费级硬件上运行。