大家怎么看?我们能说 Qwen 3.6 27B 打败了 Gemini 2.5 Pro 吗?或者 Sonnet 3.7?因为我在测试中发现 27B 表现更好。
摘要
一位用户询问 27B 参数的 Qwen 3.6 模型是否能在深度网络搜索、编码和代理任务上超越 Gemini 2.5 Pro 和 Sonnet 3.7,并寻求能打败 Gemini 2.5 Pro 的最低参数模型建议。
所以我基本上是在问,目前最强的千亿以下参数模型能否打败一年前的旗舰模型?这里我指的是在这三个方面打败:1. 深度网络搜索 2. 编码 3. 代理任务,比如访问 xyz 网站,点击 abc 按钮,并给我截图。如果不行,那么你能自信地说哪个模型可以打败 Gemini 2.5 Pro?(可能的最低参数模型)
相似文章
Qwen 3.8 27B Aider 得分
用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。
Qwen 3.8 27B vs Gemini 3.7 Flash (High) 实战编程对决:开源27B模型表现更优
在一项真实的C++调试项目中,Qwen 3.8 27B在识别错误和保持审慎假设方面展现出优于Gemini 3.7 Flash (High)的工程判断力,尽管后者速度更快。
Qwen 3.6 27B 太牛了
一位用户分享了在本地使用 Qwen 3.6 27B 进行复杂研究和编程的积极体验,发现它在职业建议和移民研究方面优于 Gemini Pro,同时也提到 Gemma 4 31B 存在性能问题。
Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!
Qwen3.6-35B-A3B 和 Qwen3.5-9B 模型已正式登上 Terminal-Bench 2.0 排行榜,其中 little-coder 在 35B 变体上取得 24.6% 的成绩,超越了 Gemini 2.5 Pro 和 Qwen3-Coder-480B;而 9B 模型则表明,10B 以下的本地模型能够与高难度代理基准竞争。
Qwen 3.6 35B A3B 的热度绝非虚名!
作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。