终端基准测试V4评分
摘要
终端基准测试V4评分显示,GLM-5.3在开源模型中领先,GLM-5.3-Flash在轻量模型中位居榜首,而Kimi-K3表现不佳。该基准被部分人士认为更能反映模型智能水平。
有些人表示,终端基准测试比智能指数更能反映模型智能水平。从结果来看,排名似乎确实体现了人们对开源和闭源模型的普遍观感。在开源模型中,GLM-5.3的表现独树一帜。GLM-5.3-Flash在当前顶级轻量模型中位居前列。对于Kimi-K3的体量而言,其在此基准中的表现相当不佳。Qwen3.8-27B是唯一能在此基准中取得一定成绩的小型模型。
模型 | 得分
--- | ---
GLM-5.3 | 41.9%
GLM-5.3-Flash | 32.8%
DSV4.1-Flash | 26.8%
Qwen3.8-Flash-Next | 25.3%
DSV4-Pro | 14.1%
Kimi-K3 | 12.6%
DSV4-Flash | 12.1%
Qwen3.8-27B | 5.6%
Muse Glimmer | 0.5%
gemma4-31b | 0.0%
相似文章
Terminal Bench 4.0 刚刚发布,GLM-5.3 与 Fable 5 处于同一水平,考虑到误差范围
Terminal Bench 4.0 已经发布,比较了 GLM-5.3 和 Fable 5 等 AI 模型,重点在于快速迭代以应对基准饱和,并引发了关于评估编码代理的经济高效替代方案的问题。
@cline: GLM-5.3 (max) 在新的 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max)。看到开放权重竞争如此激烈,真是令人难以置信……
GLM-5.3 (max) 在 Terminal-Bench 4.0 上超越了 GPT-5.6 Sol (max),突显了开放权重 AI 模型的竞争力,同时推广 Cline 的折扣访问。
GLM 5.3 Flash (Ox Alpha) 基准测试对比
文章讨论了 GLM-5.3-Flash 模型的基准测试对比,重点介绍了其前沿智能和成本效率,该内容来自发布博客文章。
我在真实生产任务上测试了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash。
本文对比了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash在实际任务中的性能,建议使用Kimi K3处理复杂任务,DeepSeek V4 Flash用于日常任务,其他模型适用于网络安全等特定领域。
GLM-5.2 是首个在 Terminal-Bench 上突破 80% 的开源权重模型,超越了所有其他开源模型。
GLM-5.2 是首个在 Terminal-Bench 上超过 80% 的开源权重模型,超越了所有其他开源模型乃至 Gemini,使其以极低的成本成为前沿水准的模型。