为什么 artificialanalysis.ai 在 SciCode 上将 Gemma4 排在 Qwen3.6 27b 之上

Reddit r/LocalLLaMA 新闻

摘要

关于 Artificial Analysis 如何在 SciCode 基准测试中将 Gemma 4 排在 Qwen3.6 27b 之上的讨论,质疑该排名是否反映现实世界的编码能力,还是揭示了基准测试的问题。

刚刚看到这个编码基准测试:SciCode。Artificialanalysis.ai 给出的排名与我们在实际编码中对这些模型的感受相矛盾。Gemma 4 真的那么好吗,还是基准测试有问题?
查看原文

相似文章

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。