是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA 新闻

摘要

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

免责声明:这篇文章有点像用 AI(又是 Gemma 4)写的,但它在这次任务中确实表现出色——它能输出我想要的内容,当我要求它润色或改进某些方面时,它能在不牺牲其他部分或让内容变得臃肿的情况下做到。我最近注意到,模型在技术排行榜上的表现与它们在实际任务中的表现之间存在巨大的脱节。最近,我一直在做并排测试,发现 Gemma 4(26B A4B)在实际的指令遵循方面持续优于许多“更大”或“更先进”的模型,比如 Gemini 3.5 Flash,甚至 Claude Opus 5。这里有两个具体例子:电子邮件撰写:我让 Gemini 根据特定想法写一封邮件回复。它没能遵循我的指令,而且完全没有把握住语气。我试了 Claude Opus 5,虽然它很“聪明”,但输出很潦草、过于冗长,而且听起来非常“AI 腔”。而 Gemma 4 却能精准把握这些微妙之处。它明白我什么时候想要委婉表达,而不是直白生硬——它真的能理解潜台词和意图的层次。提示词优化与工程:我尝试让 Gemini 帮我优化一个提示词,结果它每次都没能遵循我的指令。这还不仅仅是优化的问题;即使我在设计一个新提示词时告诉模型:“做 X、Y 和 Z,但避免 A、B 和 C”,Gemini 也过于字面化——它只会输出:“做 X、Y 和 Z,不要做 A、B 和 C。”这既笨拙又明显。Gemma 4 处理这类问题则很自然;它写提示词时会自然地避开 A、B 和 C,而无需显式提它们。它就是能理解。我的结论:我开始觉得像 Artificial Analysis 这类网站使用的指标,实际上并不符合普通用户(甚至开发者)的需求。我们不仅需要在数学或编码基准上取得高分;我们还需要模型真正能“听进去”、理解细微差别、并且不会对简单的指令产生幻觉。我想听听大家的看法:有没有其他人也遇到过这种“智能差距”——感觉更小/不同的模型反而比那些重量级模型更能干?你们知道有哪些排行榜或基准测试能更准确地反映真实世界的实用性和指令遵循能力,而不仅仅是原始技术指标吗?我不是因为喜欢 Gemma 才说“用 Gemma”,我知道它整体上不是“最聪明”的模型。我想知道是否还有其他模型(也许是 ChatGPT 系列?)在“理解细微差别和遵循指令”这个特定领域确实更强或更大。
查看原文

相似文章

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。