别再问该跑哪个模型了。其实只有两个。
摘要
一位科技爱好者认为,只有两个本地AI模型(Qwen 3.6 35b a3b 和 Qwen 3.6 27b)值得运行,他否定了更小的模型,并推荐对更大模型进行重度量化。
能不能别再发那些每天都有“我有一块 RTX 3060,应该跑哪个模型?”的垃圾帖了?这并不复杂。截至目前,Hugging Face 上空空如也,整个地球上只有两个本地模型:* **Qwen 3.6 35b a3b** * **Qwen 3.6 27b** 列表到此为止。你的配置不重要,你的用例也不重要。别再抱着你那完美无损、全精度的 Q8 小 1B 模型自欺欺人了,就因为它们“刚好塞进你的显存”。你看上去很可笑。去找个重度损伤、超低量化的 35B 模型,强行塞给你的 GPU,让系统内存流血流到干。一个垃圾量化的大模型比你的宝贝微模型好上无数倍。只管塞进去。如果你要抱怨开源已死,因为你本地模型无法立刻重写整个企业代码库?行啊,放弃吧,掏出你的信用卡,像其他反叛者一样去花钱用 Claude Code。能不能把这个置顶,这样大家就能闭嘴不再发帖了?谢谢。现在问题解决了,我们去接触一下现实世界吧。
相似文章
你计划如何在本地运行 Qwen3.8-2.4T-A95B?
一个社区帖,询问爱好者们计划如何在本地运行大型 Qwen3.8-2.4T-A95B 模型,并分享在个人硬件上运行巨大 AI 模型的挣扎。
为Qwen3 30B模型(Q8量化)搭建本地AI服务器:这个硬件合适吗?
讨论搭建用于Qwen3 30B模型(Q8量化)的本地AI服务器,质疑所选硬件是否合适。
@jtdavies: 在小模型上编程... 我的4xDGX Spark集群的默认模型是@UnslothAI的Qwen3.6-35B-A3B-NVFP4。我获得了极好…
一位用户测试了多种小型AI模型进行编程任务,发现Qwen3.6-27B-NVFP4在速度和准确性之间取得了最佳平衡,并指出这些模型在Java上的表现较差。
我在 MLX 上使用同一个飞行模拟提示词测试了 9 个本地模型,全部均为 Q8 量化版本,但来自不同的量化提供商。
在 MLX 框架下对 9 款量化本地大语言模型进行的基准测试表明,针对空战 HTML 提示词的测试结果显示:若要生成可用的代码输出,量化提供商的选择与模型自身的特性差异比参数量或位宽更为关键。
我们确实需要27B、35B、122B和397B规模的Qwen3.8
作者认为,发布更小规模的Qwen模型(27B、35B、122B、397B)比专注于万亿参数的大模型更能服务本地AI社区,因为后者对大多数用户来说并不实用。