在询问预算硬件时,不要相信前沿模型!
摘要
作者分享了使用 Tesla P100 GPU 进行本地AI推理的经验,发现通过 llama.cpp 优化后,它们性价比高且性能出色,尽管最初得到了前沿模型的负面建议。
今年早些时候,当我第一次考虑构建推理能力时,16GB 的 Tesla P100 只需 60 到 80 美元。我问了 Claude,它告诉我绝对不值得。没有张量核心,int4/int8 性能差,没有 BF16,不值得。需要特殊的电源配置,BIOS 中的 Above 4G 解码选项(它说得好像这是什么罕见选项),以及半 exotic 的冷却解决方案。结果我彻底优化了我的 RX6600XT 上的 llama.cpp。进展不错。我决定不管了,上周买了一块 P100,前天才到货。买了个新电源,有合适的接口(不难,也不贵,我看到好品牌有低至 60 美元的选项,我花了 100 美元买了一个有余量的),多个 llama.cpp 的分支和补丁,带有一些疯狂的优化来处理能力差距,还有一个为 Noctua 94mm 风扇 3D 打印的外壳。它在预填充阶段没有足够的静压来保持冷却,但在生成阶段足够强。我之前用 RX6600 XT 跑 Qwen3.6 35B A3B UD_Q4_K_XL,带 MTP 和 --cpu-moe 的数据是:PP ~800 在 0 上下文,降到 ~700 在 10k TG ~30-35 散文,45-50 代码。这个设置在 16bit kv 下可以做到 64k 上下文(甚至可能更高)。cpu-moe 在这方面帮助很大。只需一点调优,特别是使用 shinbunbun 的 llama.cpp 补丁,同样的模型和 MTP 设置,--n-cpu-moe 22:PP ~600 在 0 上下文,440-500 在 10k TG ~54-60 散文,66-72 代码。目前只运行 32k 上下文来让它工作。如果提高 n-cpu-moe 可以容纳更多,但我的工具不需要那么多(很少超过 30k,持久内存导致聊天本就不该太长)。我知道 3.6 35B 和基本上任何 Qwen 3.X 27B 模型之间的能力差距很大,但就价格而言,这已经很惊人了。自从我买了之后,它们涨了,大约每块涨了 15 美元。仍然可以以低于 100 美元的价格买到,实现其他方式在该价格下不可能得到的推理能力。我又买了一块,这样我就可以完全卸载模型,甚至可能开始尝试 3.8 27b。目前 IQ3_K_XL 带 MTP 我能得到大约 9 个 token 每秒,基本没有真正的上下文。实际上不知道将适合一张卡的模型拆分到多张卡是否有助于速度,这对我来说是全新的领域,但无论如何我玩得很开心。这块卡被严重低估了。它是获得强大计算能力开始本地AI工作的好且(相对)便宜的方式。我从必须让电脑在模型运行时闲置,用 MacBook 做所有事情(告别游戏)变成了能在 PC 上做任何事的同时让模型在后台运行和工作。当第二块卡到货时,我会计划一个专用的推理机箱,让它们都住在里面。受到那个用大众散热器冷却 PC 的家伙的启发。
相似文章
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
对15款“电子垃圾”GPU进行现代工作负载基准测试
对15款退役的NVIDIA Tesla GPU(K80、P100、V100)进行现代AI工作负载基准测试,展示它们在家庭实验室推理设置中的可行性和性价比。
@AryaTschand: 我在英伟达架构研究部门的实习中,大部分时间都在思考前沿LLM应如何在我们的最新(异构)系统上进行推理……
一位英伟达实习生分享了关于前沿LLM如何在异构系统上进行推理的研究见解,附有包含TLDR和迷你实验的推文串。
我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。
作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。
@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。