Qwen 3.6 35B A3B 与 Qwen 3.5 122B A10B 对比

Reddit r/LocalLLaMA 模型

摘要

用户反馈,尽管基准测试表现亮眼,Qwen 3.5 122B 在多步任务上大幅领先 Qwen 3.6 35B,怀疑是量化或部署配置问题。

有没有人对比过这两款模型?对我来说,3.5 122B 明显碾压 3.6。只要任务多几步,3.6 就开始掉链子。之所以发问,是因为看某些榜单 3.6 分数挺高,我怀疑自己是不是哪里配错了?实际体验完全相反。如果能优化一下、兼得速度就太香了,各位有招儿吗? 编辑:我这边用的是 Qwen3.5 122b UD-Q5_K_XL 和 Qwen3.6 35b UD-Q8_K_XL。也许该上完整 BF16,但我感觉差距不该这么大。CUDA runtime 是 13.1,我知道 13.2 对小量化版有坑。
查看原文

相似文章

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。

Qwen 3.6 35B A3B 的热度绝非虚名!

Reddit r/LocalLLaMA

作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。

Qwen 3.6 35B GGUF:跨GPU和CPU的NTP vs MTP量化结果

Reddit r/LocalLLaMA

ByteShape发布了Qwen 3.6 35B GGUF的NTP和MTP变体量化,并在多个GPU和CPU上进行了详细基准测试,发现更大的量化模型通常优于较小的模型,MTP以内存为代价提供了GPU速度提升。