我选择模型的经验法则
摘要
作者分享个人经验,展示像 Qwen 27B 这样的大语言模型如何大幅缩短编程任务时间,并提供了模型选择的经验法则。
这主要是为了设定预期,因为个人在没有大语言模型的情况下,可能需要 3 天(15 小时的主动编程时间)来调试或实现一个功能,但使用 Qwen 27B(甚至在 Qwen 3.8 之前)则只需 4 小时。而且,是的,0.5 tok/s 是人类水平,还没有算上删除和暂停的时间,这也是我能放心地过夜对代码库进行全面分析,或进行金融科技和深度研究的原因。
相似文章
中型MoE大语言模型
用户寻求中等规模的混合专家大语言模型(MoE)推荐(最高60B参数(float8)/110B参数(mxfp4)),列出了Qwen 3.5 35B、Gemma 4 A4B和Nemotron 3 Nano,并询问除此之外还有哪些小众选择。
别再问该跑哪个模型了。其实只有两个。
一位科技爱好者认为,只有两个本地AI模型(Qwen 3.6 35b a3b 和 Qwen 3.6 27b)值得运行,他否定了更小的模型,并推荐对更大模型进行重度量化。
我现在(主要)根据速度而非智能来挑选模型
作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。
LLM规划器 - 根据你的用例/模型/预算选择设备,或根据你的设备选择模型。60+配置方案,50+模型,130+引用t/s来源,150+评测YouTube视频,待机+运行功耗,多区域价格,定期更新。
一个全面的网络工具和公共数据集,帮助用户选择适合运行LLM的硬件,包含60+配置方案、50+模型、性能基准测试和评测视频,支持模型与硬件的双向匹配。
我在 MLX 上使用同一个飞行模拟提示词测试了 9 个本地模型,全部均为 Q8 量化版本,但来自不同的量化提供商。
在 MLX 框架下对 9 款量化本地大语言模型进行的基准测试表明,针对空战 HTML 提示词的测试结果显示:若要生成可用的代码输出,量化提供商的选择与模型自身的特性差异比参数量或位宽更为关键。