Qwen3.8 27B vs Qwen3.6 27B vs Qwen3.5 27B,代际间在单次提示能力上的轻微提升。

Reddit r/LocalLLaMA 新闻

摘要

对Qwen 27B模型跨代比较显示单次提示能力有轻微提升,平均评分从2.46提高到3.00。

对Qwen3.8 27B在oneshotlm上运行了所有35个单次提示,并与Qwen3.6 27B和Qwen3.5 27B进行了比较。以下是结果。3.6无法创建一个可运行的2048游戏,但3.8做到了。3.8的鹈鹕是准确的。3.8能够基本正确地绘制Wolfenstein,而3.6没有绘制任何内容。我使用Sonnet 5评估了所有这些模型的输出,看起来平均评分在27B代际间从2.46增加到3.00。
查看原文

相似文章

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。