GLM 5.3 SlopCodeBench 成绩
摘要
GLM 5.3 在 SlopCodeBench 上的基准测试结果显示,它在某子集上得分47.1%,在另一子集上与 Fable 5 和 GPT-5.6 Sol 并列,表明所有模型都在这个未饱和的编程基准上遇到困难。
大家好,再次问候!有人请求我在基准测试中试试 5.3 版本——它们还是未饱和的,所以现在是个有趣的测试!这次很有趣,因为我不小心在所有 36 个问题上运行了它(损失了 $200),而不是通常的 9 个问题。之前的运行 a b c 基准测试上下文:AI 被要求逐步构建一个工具,我们在中途添加新要求——它必须处理新事物而不破坏旧事物——基准测试隐藏了旧测试。所以它并没有像其他所有 AI 那样神奇地解决基准测试,我认为目前还没有一次成功的解决,但它确实在相同问题子集中与 Fable/Sol 并列!另一个我们预期的有趣之处是,问题越难,花费越多——因此难度似乎与为解决问题而输出的令牌数相关。简而言之,完整结果:在 Opus 5 报告的三题、17 检查点列表中,GLM 严格得分 8/17(47.1%)。在 Fable、Sol 和 Kimi 报告的六题、30 检查点列表中,它得分 10/30(33.3%),在严格阈值上与 Fable 5 和 GPT-5.6 Sol 并列。报告的系统 Opus 列表 · 17 Fable/Sol/Kimi 列表 · 30 GLM-5.3 · pi 8 (47.1%) 10 (33.3%) DeepSeek V4 Flash 0731 · pi B 5 (29.4%) — Opus 5 · Claude Code 4 (23.5%) — Qwen3.8-27B · pi 3 (17.6%) 4 (13.3%) DeepSeek V4 Flash · OpenCode 3 (17.6%) — Fable 5 · Claude Code — 10 (33.3%) GPT-5.6 Sol · Codex — 10 (33.3%) Kimi K3 · Modal / OpenCode — 8 (26.7%) Kimi K3 · Baseten / OpenCode — 7 (23.3%)
相似文章
GLM得分高于GPT,但如何验证基准测试的有效性?
文章比较了GLM-5.3与GPT-5.5等AI模型在基准测试中的性能指标,强调了成本效益并质疑基准测试的效度,同时探讨高效的方法论评估方式。
GLM-5.2 刚发布开放权重,在编程方面已经异常强大
GLM-5.2 已以 MIT 许可证发布开放权重,拥有 100 万上下文窗口和两种推理努力模式。早期基准测试显示它在编程任务中表现出色,值得在基准截图之外进行测试。
Terminal Bench 4.0 刚刚发布,GLM-5.3 与 Fable 5 处于同一水平,考虑到误差范围
Terminal Bench 4.0 已经发布,比较了 GLM-5.3 和 Fable 5 等 AI 模型,重点在于快速迭代以应对基准饱和,并引发了关于评估编码代理的经济高效替代方案的问题。
@cline: GLM-5.3 (max) 在新的 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max)。看到开放权重竞争如此激烈,真是令人难以置信……
GLM-5.3 (max) 在 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max),突显了开放权重 AI 模型的竞争力,同时推广 Cline 的折扣访问。
GLM 5.2 对比 Opus
GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。