GLM 5.2 FP8 with FP8 KV - Terminal-Bench 2.1 = 79.8 (有一个超时未重新运行)

Reddit r/LocalLLaMA 模型

摘要

在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。

我想对比官方结果与 fp8 + fp8 kv 的测试。在 H200 上使用基本 sglang 设置。如果有人想要一个官方测试,请 ping 我。我没有重新运行那个测试,所以结果可能会稍微提高一点 :) TERMINAL-BENCH 2.1 — 最终结果(mymodel 通过 mini-swe-agent) 总计:89 个任务 通过:71 (79.8%) 失败:17 错误:1 输入 tokens 218,656,815 缓存 tokens 216,036,672 输出 tokens 4,659,650 缓存命中率 98.8% 新输入 tokens 2,620,143 失败 (17) — 完成但答案错误 configure-git-webserver db-wal-recovery dna-assembly dna-insert extract-moves-from-video filter-js-from-html gcode-to-text install-windows-3.11 model-extraction-relu-logits mteb-leaderboard protein-assembly query-optimize raman-fitting regex-chess torch-pipeline-parallelism video-processing winning-avg-corewars 错误 (1) — 超时 torch-tensor-parallelism [VerifierTimeoutError — 未重新运行]
查看原文

相似文章

终端基准测试V4评分

Reddit r/LocalLLaMA

终端基准测试V4评分显示,GLM-5.3在开源模型中领先,GLM-5.3-Flash在轻量模型中位居榜首,而Kimi-K3表现不佳。该基准被部分人士认为更能反映模型智能水平。