Qwen 3.8 27b 即使在 Q3_xxs 下也很强大

Reddit r/LocalLLaMA 模型

摘要

用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。

通常我会避免 Q3 量化,因为我之前有过不好的体验,模型通常退化太严重,所以我通常只用 Q4,因为我只有 RTX 4060 Ti 16GB。但既然还没有发布 35b-3ab,我不得不尝试一下。我不在代理工作流中使用 LLMs,只在 Textgen 上使用,因为我不是程序员,所以这不是我使用 LLMs 的主要目的——但有时我确实需要一些编码能力或帮助。我非常印象深刻,它一次性完成了多个严重的编码任务,生成了完全可运行的游戏或网页应用,而之前的 Qwen 3.6 35b 在其中一些任务中完全失败或挣扎很大,需要数小时/天的协助/提示、反馈才能使其工作。当完全在显存中时,它非常快。30-35t/s,基本上和更高量化 35b 卸载到内存的速度一样!只有在长上下文时,它才下降到 21-22t/s。较旧的密集模型如 Gemma 3 27b、Mistral small 24b 最好也只能达到 13-17t/s。我注意到的唯一问题是,它有时在日常对话中误解事情,或在基本排序或计算几个分数时失败,同时却能一次性完成严重的数学/逻辑任务。不确定这是因为它针对代码优化过度还是因为低量化(我猜主要是后者,但我对能运行更高量化的用户的经验很感兴趣)。到目前为止,我非常满意,它比我之前尝试的更高 Q4-Q5 MoEs 要好得多。
查看原文

相似文章

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。