2400cc 推理竞速机:双RTX 3090引擎,NVLink涡轮增压,裸机7840U ThinkPad ECU,大众高尔夫散热器
摘要
一台使用双RTX 3090 GPU、ThinkPad主板和大众高尔夫散热器自制的推理机,能够通过vLLM运行如Qwen3.8-27B等AI模型。
今天我呈现一个精心组装的工程杰作:2400cc推理竞速机,又名我的冬季取暖器。电源来自两张二手AORUS RTX 3090 XTREME WATERFORCE显卡。一张发出美丽的青绿色光,另一张红色。我不知道为什么,也无法改变,所以这显然成了官方配色方案。整个系统由一块独立供电的联想ThinkPad主板管理,配备Ryzen 7 7840U和64 GB RAM。没有电池、屏幕、键盘、外壳或其他不必要的奢侈品。裸机主板通过定制铝制水冷头、过多的Arctic散热膏和一种被称为夹子的精密安装机制进行冷却。冷却由一个24欧元的VW Golf散热器提供,通过一系列精心挑选的、大致兼容的软管、接头、适配器和乐观精神连接。循环系统装有约2.4升冷却液,因此得名2400cc排量。当前可靠性极佳:每天泄漏少于100毫升,只要温度不太高。PCIe拓扑同样合理。一块GPU通过ThinkPad的WWAN插槽以PCIe Gen4 x1连接,另一块使用SSD插槽以Gen2 x4连接。BIOS必须打补丁以移除硬件白名单、修改PCIe上电序列并禁用PCIe节能状态。SSD插槽技术上支持Gen4 x4,但'技术上可行'和'稳定'原来是两个不同的概念。两张3090通过NVLink连接,幸运的是,这意味着一旦推理运行起来,有疑问的主机PCIe配置就不再那么重要了。目前运行Ubuntu,通过vLLM提供Qwen3.8-27B服务,安静且速度惊人地不错。我仍在调整设置以提升性能。它还能完全不带3090启动。在这种配置下,它变成一个低空闲功耗服务器,可以在7840U上使用其64 GB共享系统RAM、Vulkan和llama.cpp运行较小的模型,非常适合我们名为Hoot的常驻Hermes机器人。但热插拔功能仍未实现。家庭推理工程的巅峰之作。
相似文章
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 在双RTX 3090上
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
双Tesla p100, q6_k量化, Qwen 3.8 27B 约60 tps V3.0
一位用户分享了针对Tesla P100 GPU的内核优化,以提升使用llama.cpp运行Qwen 3.8模型时的性能,实现了显著的推理加速。
@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
Dailychained PLX 88096 交换机,四路 RTX 5070 Ti + 四路 RTX 5060 Ti
一位用户分享了使用 RTX 5070 Ti 和 5060 Ti 构建多 GPU 系统的经验,该系统用于在 Linux 上通过 vLLM 运行 Qwen3.8-27B-FP8 等 AI 模型,详细介绍了硬件设置、基准测试和挑战。