Qwen3.5 122B 是最好的吗?
摘要
一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。
我使用的是 Opencode 和一台 128GB 内存的电脑。所以结果可能因系统而异。我费尽心力试过了 Qwen3.6 27B 和 Qwen3.6 33B。不知道为什么,它们在执行包含大量工具调用的复杂任务时就会崩溃。它们相当激进,会做比要求稍多一点的事情,最终把自己陷入麻烦。Gemma4 31B 和 26B 则完全相反。它们就是无法简单完成任务。我不得不坐在那里看着它们,一直说“好,好,好”。Qwen 和 Gemma 的 MoE 模型上的工具调用感觉有 bug,经常只返回空白响应。我一直回过来使用的模型是 Qwen3.5 122B。它似乎总能完成任务。我花了一整天试图用这些模型从大约 160 个 PowerPoint 文件中提取几个特定数据字段,结果却问题不断。我直接告诉 Qwen3.5 122B 我想要的目标,它大约 2 小时就完成了。我觉得市面上那些全稠密的约 30B 模型还算可以,但它们的速度根本不值一提。这个规模附近的 MoE 模型就是垃圾。你不如用一台 16GB 内存的电脑,通过 API 使用模型。120B 规模的 MoE 模型在能力与速度之间达到了绝佳平衡。我真的很希望能看到更多这个规模的模型。是的,不是每个人都有这么大的内存,但我真心觉得用更小的模型只是在浪费时间和精力。有人有同感吗?
相似文章
Gemma 4 26b a4b 确实是我尝试过的最适合语言学习和科学查询的模型!
用户报告称,Gemma 4 26b 在语言学习和科学查询方面优于 Qwen 3.5/3.6,尽管在编码任务上稍显逊色,并邀请大家讨论小型 MoE 模型在编码以外的其他用例。
我在 RTX 5090 上用同一真实架构写作任务实测 Qwen3.6-27B、Qwen3.6-35B-A3B、Qwen3.5-27B 与 Gemma 4
在 RTX 5090 上,让四款本地大模型——Qwen3.6-27B、Qwen3.6-35B、Qwen3.5-27B 与 Gemma 4——完成 2 万 token 架构写作任务,结果显示 Qwen3.6-27B 在清晰度、完整性与实用性上取得最佳综合平衡。
@cjzafir:Qwen 3.5 4B 和 8B 模型太棒了。我今天微调了一个 4B 模型,在全精度和 Q8 量化版本上达到了 98% 的准确率…
一位开发者报告称,使用 Unsloth 微调 Qwen 3.5 4B 和 8B 模型后取得了高准确率,这表明业界正转向针对细分任务使用专用的专家语言模型(ELMs)。
Qwen3.6 是当前本地代理使用的最佳模型吗?
有用户报告称,Qwen3.6 35B A3B 在代理任务上优于 Gemma4 和 GLM 4.7 Flash REAP 等其他本地模型,不过偶尔仍会出现循环。
Qwen 35b a3b 令我惊喜
用户报告了使用 Qwen 35b a3b 进行代理编码任务的积极体验,指出在其使用场景中它优于 Gemma4 26b,并且在演示/数据分析方面表现出色,尤其是在代理模式而非聊天模式下。