Qwen 3.6 27B 在代理任务上完全失败
摘要
一位用户报告称,Qwen 3.6 27B 虽然在单次提示任务中表现强劲,但在代理任务中频繁出错,导致其不得不回退到 Qwen 3.5 122B。
我使用 Qwen 3.5 122B 的 4 位量化版已经有一段时间了,最近在 Llama.cpp 性能与 VLLM 相当后,我开始使用 5 位量化版。我还多次尝试过使用 8 位和 16 位量化的 Qwen 3.6 27B,因为很多人声称 27B 比 122B 更好。确实,在单次提示上它表现更好。它能生成非常令人印象深刻的演示 HTML 页面。它生成的内容长度远超 3.5 系列的任何模型。然而,在代理任务上,它完全崩溃了。它不断出错,并且不遵循指令。我无法让这个模型不出错。大约每四轮对话,它就会做一些完全无脑的事情。我是唯一注意到这一点的人吗?在再次尝试让 27B 工作失败后,我又回到了使用 122B。环境是 Llama.cpp(从 Git 每晚编译),运行在 RTX 6000 上。
相似文章
Qwen3.6 是当前本地代理使用的最佳模型吗?
有用户报告称,Qwen3.6 35B A3B 在代理任务上优于 Gemma4 和 GLM 4.7 Flash REAP 等其他本地模型,不过偶尔仍会出现循环。
Qwen 35b a3b 令我惊喜
用户报告了使用 Qwen 35b a3b 进行代理编码任务的积极体验,指出在其使用场景中它优于 Gemma4 26b,并且在演示/数据分析方面表现出色,尤其是在代理模式而非聊天模式下。
Qwen/Qwen3.6-27B
Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。
Qwen 3.6 35B A3B 与 Qwen 3.5 122B A10B 对比
用户反馈,尽管基准测试表现亮眼,Qwen 3.5 122B 在多步任务上大幅领先 Qwen 3.6 35B,怀疑是量化或部署配置问题。
我无法让Qwen3.6 27B超越Qwen-Coder-Next,不确定原因
用户报告称,Qwen-Coder-Next 在实际测试和合成基准测试中均优于 Qwen3.6 27B,尽管其他人称赞 27B,用户寻求关于可能设置问题的建议。