Simple Bench - QWEN 3.8 27b 几乎拥有与 GPT 5.0 Pro 相似的常识能力??

Reddit r/singularity 新闻

摘要

一项名为 Simple Bench 的基准测试表明,QWEN 3.8 27b 模型具有几乎可与 GPT 5.0 Pro 相媲美的常识能力。

卧槽,他们真的做到了。 https://simple-bench.com/
查看原文

相似文章

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

Qwen 3.6 Q2-FP8 终端基准2和GPQA得分

Reddit r/LocalLLaMA

本文报告了Qwen 3.6模型的基准测试结果,显示量化对知识基准(GPQA)影响很小,但会显著降低智能体性能(Terminal-Bench 2),并进一步讨论了超时设置和运行差异。

Qwen 3.8 27B SlopCodeBench 测试结果

Reddit r/LocalLLaMA

这篇文章展示了 Qwen 3.8 27B 模型在 SlopCodeBench 上的基准测试结果,显示在严格检查点上表现不佳,但在核心检查点上表现尚可,这表明在没有指导的情况下,它可能不适合自主代码管理。