GLM 5.2 FP8 with FP8 KV - Terminal-Bench 2.1 = 79.8 (有一个超时未重新运行)
摘要
在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。
我想对比官方结果与 fp8 + fp8 kv 的测试。在 H200 上使用基本 sglang 设置。如果有人想要一个官方测试,请 ping 我。我没有重新运行那个测试,所以结果可能会稍微提高一点 :)
TERMINAL-BENCH 2.1 — 最终结果(mymodel 通过 mini-swe-agent)
总计:89 个任务 通过:71 (79.8%) 失败:17 错误:1
输入 tokens 218,656,815 缓存 tokens 216,036,672 输出 tokens 4,659,650 缓存命中率 98.8% 新输入 tokens 2,620,143
失败 (17) — 完成但答案错误 configure-git-webserver db-wal-recovery dna-assembly dna-insert extract-moves-from-video filter-js-from-html gcode-to-text install-windows-3.11 model-extraction-relu-logits mteb-leaderboard protein-assembly query-optimize raman-fitting regex-chess torch-pipeline-parallelism video-processing winning-avg-corewars
错误 (1) — 超时 torch-tensor-parallelism [VerifierTimeoutError — 未重新运行]
相似文章
在4台DGX Spark上运行4-bit量化GLM-5.2(753B MoE):Terminal-Bench 2.1得分70.8%,完整模型为81.0%
在4台DGX Spark机器上运行4-bit量化版GLM-5.2(753B MoE),Terminal-Bench 2.1得分为70.8%,而完整模型为81.0%。
终端基准测试V4评分
终端基准测试V4评分显示,GLM-5.3在开源模型中领先,GLM-5.3-Flash在轻量模型中位居榜首,而Kimi-K3表现不佳。该基准被部分人士认为更能反映模型智能水平。
@0xSero:我们找到了一种在 vLLM 中以完整上下文运行 GLM-5.2 且无需剪枝的方法。 - 前 32 个专家使用 NVFP4 - 其余使用 fp3 - intel auto…
一位社区研究员通过混合量化(NVFP4、NF3、MXFP8),在无需剪枝的情况下,在 vLLM 中运行了 GLM-5.2(753B 参数,全部 256 个专家),可在 4×96GB GPU 上运行,拥有约 307k KV 缓存,精度接近 FP8。
GLM-5.2在8×B200上的部署数学:没人详细说明的部分——NVFP4 + 2个TP=4副本比TP=8快约2倍,内含完整配置指导。
本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。
自托管 Gemma 2 9B 与前沿 API 基准测试:NVIDIA L4 上的 FP8 量化预填充代价与显存现实 [P]
该基准测试将未量化的 Gemma 2 9B 模型与 FP8 量化变体在 NVIDIA L4 GPU 上进行比较,揭示了 FP8 量化引入了预填充代价(更高的 TTFT),但改善了解码延迟和显存使用,且在狭窄任务中语义漂移极小。