Gemma 4 仍然偷懒
摘要
用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。
请告诉我我哪里做错了。我的配置:
[*] flash-attn = on jinja = true fit = true offline = true mmproj-offload = false mmap = false cram = -1 parallel = 1 [unsloth/gemma-4-31B-it-qat-UD-Q4_K_XL-TP-WORK-147K] hf = unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL ctx-size = 147456 temp = 1.0 top-p = 0.95 top-k = 64 sm = tensor fit = off spec-default = true chat-template-kwargs = {"preserve_thinking": true}
我已经拉取了最新的 Unsloth GGUF,带有新的聊天模板,并设置 preserve_thinking 为 true,但 Gemma 在代理任务上仍然糟糕透顶。我在 Hermes 中给它一个任务,它会进行几次工具调用,然后回复类似“我做了 A,但 B 和 C 发生了,现在我要做 D”这样的话,然后就停了。我告诉它只管执行任务不要停,它又重复了一遍。这不是 Qwen 3.6 27B (UD-Q5_K_XL) 的问题,也不是 DeepSeek V4 Flash (UD-IQ3_XXS) 的问题,甚至老版的 GPT-OSS 120B 也没有这个问题——所有这些模型,我都可以给一个任务,然后回来发现它们还在有效地解决问题。那么,Gemma 4 到底怎么回事?这个模型真的不适合多轮代理工作吗?公平地说,Gemma 是一款很棒的聊天机器人。我喜欢和它讨论世界观构建之类的话题。但感觉它根本不想在代理任务上花力气,尽管它显然是一个能力很强的模型。
相似文章
Gemma 4 26b a4b 确实是我尝试过的最适合语言学习和科学查询的模型!
用户报告称,Gemma 4 26b 在语言学习和科学查询方面优于 Qwen 3.5/3.6,尽管在编码任务上稍显逊色,并邀请大家讨论小型 MoE 模型在编码以外的其他用例。
Gemma 4 12b QAT 对于我的用例来说是一种倒退,尽管热议纷纷.. 不是我的主要推荐
作者报告称,与标准 Q5_K_L 版本相比,Gemma 4 12b QAT 模型由于控制令牌配置错误导致的 bug,在工具调用和编码任务上出现了倒退。尽管令牌速度很高,但模型输出不一致,使其不适合代理工作流。
Gemma 4 26b 为何不受关注?
一位用户询问为什么 Gemma 4 26b 相比 Qwen 模型关注度较低,并分享了他们在 3090 上使用这些模型构建个人助手项目的经验。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。
Cerebras上的gemma-4-31B比ChatGPT语音模式更好
声称在Cerebras硬件上运行的Gemma-4-31B模型性能优于ChatGPT的语音模式,并通过Hugging Face Space展示了实时语音交互。