Qwen3.7 Max在Artificial Analysis评测中得分,27B/35B等待室

Reddit r/LocalLLaMA 模型

摘要

Qwen3.7 Max在Artificial Analysis基准测试中排名第五,与GPT-5.4持平,并超越了刚发布的Gemini 3.5 Flash,而Qwen3.6 27B则明显落后。

https://preview.redd.it/42ak5qmus82h1.png?width=1133&format=png&auto=webp&s=744ea3dfc06c83d0c4d8aa128c39b3238b17d7be Qwen 3.7 Max位列第五,与GPT 5.4 (xhigh)基本持平,略高于刚发布的Gemini 3.5 Flash。在另一端,我们看到DSV4 Flash和Qwen3.6 27B,后者比其最大版本正好落后6分。希望Qwen3.7也能与其最大版大哥处于同一水平。
查看原文

相似文章

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。