Gemma 4 仍然偷懒

Reddit r/LocalLLaMA 新闻

摘要

用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。

请告诉我我哪里做错了。我的配置: [*] flash-attn = on jinja = true fit = true offline = true mmproj-offload = false mmap = false cram = -1 parallel = 1 [unsloth/gemma-4-31B-it-qat-UD-Q4_K_XL-TP-WORK-147K] hf = unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL ctx-size = 147456 temp = 1.0 top-p = 0.95 top-k = 64 sm = tensor fit = off spec-default = true chat-template-kwargs = {"preserve_thinking": true} 我已经拉取了最新的 Unsloth GGUF,带有新的聊天模板,并设置 preserve_thinking 为 true,但 Gemma 在代理任务上仍然糟糕透顶。我在 Hermes 中给它一个任务,它会进行几次工具调用,然后回复类似“我做了 A,但 B 和 C 发生了,现在我要做 D”这样的话,然后就停了。我告诉它只管执行任务不要停,它又重复了一遍。这不是 Qwen 3.6 27B (UD-Q5_K_XL) 的问题,也不是 DeepSeek V4 Flash (UD-IQ3_XXS) 的问题,甚至老版的 GPT-OSS 120B 也没有这个问题——所有这些模型,我都可以给一个任务,然后回来发现它们还在有效地解决问题。那么,Gemma 4 到底怎么回事?这个模型真的不适合多轮代理工作吗?公平地说,Gemma 是一款很棒的聊天机器人。我喜欢和它讨论世界观构建之类的话题。但感觉它根本不想在代理任务上花力气,尽管它显然是一个能力很强的模型。
查看原文

相似文章

Gemma 4 26b 为何不受关注?

Reddit r/LocalLLaMA

一位用户询问为什么 Gemma 4 26b 相比 Qwen 模型关注度较低,并分享了他们在 3090 上使用这些模型构建个人助手项目的经验。

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。