Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。

我使用的是 Opencode 和一台 128GB 内存的电脑。所以结果可能因系统而异。我费尽心力试过了 Qwen3.6 27B 和 Qwen3.6 33B。不知道为什么,它们在执行包含大量工具调用的复杂任务时就会崩溃。它们相当激进,会做比要求稍多一点的事情,最终把自己陷入麻烦。Gemma4 31B 和 26B 则完全相反。它们就是无法简单完成任务。我不得不坐在那里看着它们,一直说“好,好,好”。Qwen 和 Gemma 的 MoE 模型上的工具调用感觉有 bug,经常只返回空白响应。我一直回过来使用的模型是 Qwen3.5 122B。它似乎总能完成任务。我花了一整天试图用这些模型从大约 160 个 PowerPoint 文件中提取几个特定数据字段,结果却问题不断。我直接告诉 Qwen3.5 122B 我想要的目标,它大约 2 小时就完成了。我觉得市面上那些全稠密的约 30B 模型还算可以,但它们的速度根本不值一提。这个规模附近的 MoE 模型就是垃圾。你不如用一台 16GB 内存的电脑,通过 API 使用模型。120B 规模的 MoE 模型在能力与速度之间达到了绝佳平衡。我真的很希望能看到更多这个规模的模型。是的,不是每个人都有这么大的内存,但我真心觉得用更小的模型只是在浪费时间和精力。有人有同感吗?
查看原文

相似文章

Qwen 35b a3b 令我惊喜

Reddit r/LocalLLaMA

用户报告了使用 Qwen 35b a3b 进行代理编码任务的积极体验,指出在其使用场景中它优于 Gemma4 26b,并且在演示/数据分析方面表现出色,尤其是在代理模式而非聊天模式下。