终端基准测试V4评分

Reddit r/LocalLLaMA 新闻

摘要

终端基准测试V4评分显示,GLM-5.3在开源模型中领先,GLM-5.3-Flash在轻量模型中位居榜首,而Kimi-K3表现不佳。该基准被部分人士认为更能反映模型智能水平。

有些人表示,终端基准测试比智能指数更能反映模型智能水平。从结果来看,排名似乎确实体现了人们对开源和闭源模型的普遍观感。在开源模型中,GLM-5.3的表现独树一帜。GLM-5.3-Flash在当前顶级轻量模型中位居前列。对于Kimi-K3的体量而言,其在此基准中的表现相当不佳。Qwen3.8-27B是唯一能在此基准中取得一定成绩的小型模型。 模型 | 得分 --- | --- GLM-5.3 | 41.9% GLM-5.3-Flash | 32.8% DSV4.1-Flash | 26.8% Qwen3.8-Flash-Next | 25.3% DSV4-Pro | 14.1% Kimi-K3 | 12.6% DSV4-Flash | 12.1% Qwen3.8-27B | 5.6% Muse Glimmer | 0.5% gemma4-31b | 0.0%
查看原文

相似文章