在询问预算硬件时,不要相信前沿模型!

Reddit r/LocalLLaMA 新闻

摘要

作者分享了使用 Tesla P100 GPU 进行本地AI推理的经验,发现通过 llama.cpp 优化后,它们性价比高且性能出色,尽管最初得到了前沿模型的负面建议。

今年早些时候,当我第一次考虑构建推理能力时,16GB 的 Tesla P100 只需 60 到 80 美元。我问了 Claude,它告诉我绝对不值得。没有张量核心,int4/int8 性能差,没有 BF16,不值得。需要特殊的电源配置,BIOS 中的 Above 4G 解码选项(它说得好像这是什么罕见选项),以及半 exotic 的冷却解决方案。结果我彻底优化了我的 RX6600XT 上的 llama.cpp。进展不错。我决定不管了,上周买了一块 P100,前天才到货。买了个新电源,有合适的接口(不难,也不贵,我看到好品牌有低至 60 美元的选项,我花了 100 美元买了一个有余量的),多个 llama.cpp 的分支和补丁,带有一些疯狂的优化来处理能力差距,还有一个为 Noctua 94mm 风扇 3D 打印的外壳。它在预填充阶段没有足够的静压来保持冷却,但在生成阶段足够强。我之前用 RX6600 XT 跑 Qwen3.6 35B A3B UD_Q4_K_XL,带 MTP 和 --cpu-moe 的数据是:PP ~800 在 0 上下文,降到 ~700 在 10k TG ~30-35 散文,45-50 代码。这个设置在 16bit kv 下可以做到 64k 上下文(甚至可能更高)。cpu-moe 在这方面帮助很大。只需一点调优,特别是使用 shinbunbun 的 llama.cpp 补丁,同样的模型和 MTP 设置,--n-cpu-moe 22:PP ~600 在 0 上下文,440-500 在 10k TG ~54-60 散文,66-72 代码。目前只运行 32k 上下文来让它工作。如果提高 n-cpu-moe 可以容纳更多,但我的工具不需要那么多(很少超过 30k,持久内存导致聊天本就不该太长)。我知道 3.6 35B 和基本上任何 Qwen 3.X 27B 模型之间的能力差距很大,但就价格而言,这已经很惊人了。自从我买了之后,它们涨了,大约每块涨了 15 美元。仍然可以以低于 100 美元的价格买到,实现其他方式在该价格下不可能得到的推理能力。我又买了一块,这样我就可以完全卸载模型,甚至可能开始尝试 3.8 27b。目前 IQ3_K_XL 带 MTP 我能得到大约 9 个 token 每秒,基本没有真正的上下文。实际上不知道将适合一张卡的模型拆分到多张卡是否有助于速度,这对我来说是全新的领域,但无论如何我玩得很开心。这块卡被严重低估了。它是获得强大计算能力开始本地AI工作的好且(相对)便宜的方式。我从必须让电脑在模型运行时闲置,用 MacBook 做所有事情(告别游戏)变成了能在 PC 上做任何事的同时让模型在后台运行和工作。当第二块卡到货时,我会计划一个专用的推理机箱,让它们都住在里面。受到那个用大众散热器冷却 PC 的家伙的启发。
查看原文

相似文章