GLM 5.3 SlopCodeBench 成绩

Reddit r/LocalLLaMA 新闻

摘要

GLM 5.3 在 SlopCodeBench 上的基准测试结果显示,它在某子集上得分47.1%,在另一子集上与 Fable 5 和 GPT-5.6 Sol 并列,表明所有模型都在这个未饱和的编程基准上遇到困难。

大家好,再次问候!有人请求我在基准测试中试试 5.3 版本——它们还是未饱和的,所以现在是个有趣的测试!这次很有趣,因为我不小心在所有 36 个问题上运行了它(损失了 $200),而不是通常的 9 个问题。之前的运行 a b c 基准测试上下文:AI 被要求逐步构建一个工具,我们在中途添加新要求——它必须处理新事物而不破坏旧事物——基准测试隐藏了旧测试。所以它并没有像其他所有 AI 那样神奇地解决基准测试,我认为目前还没有一次成功的解决,但它确实在相同问题子集中与 Fable/Sol 并列!另一个我们预期的有趣之处是,问题越难,花费越多——因此难度似乎与为解决问题而输出的令牌数相关。简而言之,完整结果:在 Opus 5 报告的三题、17 检查点列表中,GLM 严格得分 8/17(47.1%)。在 Fable、Sol 和 Kimi 报告的六题、30 检查点列表中,它得分 10/30(33.3%),在严格阈值上与 Fable 5 和 GPT-5.6 Sol 并列。报告的系统 Opus 列表 · 17 Fable/Sol/Kimi 列表 · 30 GLM-5.3 · pi 8 (47.1%) 10 (33.3%) DeepSeek V4 Flash 0731 · pi B 5 (29.4%) — Opus 5 · Claude Code 4 (23.5%) — Qwen3.8-27B · pi 3 (17.6%) 4 (13.3%) DeepSeek V4 Flash · OpenCode 3 (17.6%) — Fable 5 · Claude Code — 10 (33.3%) GPT-5.6 Sol · Codex — 10 (33.3%) Kimi K3 · Modal / OpenCode — 8 (26.7%) Kimi K3 · Baseten / OpenCode — 7 (23.3%)
查看原文

相似文章

GLM 5.2 对比 Opus

Hacker News Top

GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。