2400cc 推理竞速机:双RTX 3090引擎,NVLink涡轮增压,裸机7840U ThinkPad ECU,大众高尔夫散热器

Reddit r/LocalLLaMA 新闻

摘要

一台使用双RTX 3090 GPU、ThinkPad主板和大众高尔夫散热器自制的推理机,能够通过vLLM运行如Qwen3.8-27B等AI模型。

今天我呈现一个精心组装的工程杰作:2400cc推理竞速机,又名我的冬季取暖器。电源来自两张二手AORUS RTX 3090 XTREME WATERFORCE显卡。一张发出美丽的青绿色光,另一张红色。我不知道为什么,也无法改变,所以这显然成了官方配色方案。整个系统由一块独立供电的联想ThinkPad主板管理,配备Ryzen 7 7840U和64 GB RAM。没有电池、屏幕、键盘、外壳或其他不必要的奢侈品。裸机主板通过定制铝制水冷头、过多的Arctic散热膏和一种被称为夹子的精密安装机制进行冷却。冷却由一个24欧元的VW Golf散热器提供,通过一系列精心挑选的、大致兼容的软管、接头、适配器和乐观精神连接。循环系统装有约2.4升冷却液,因此得名2400cc排量。当前可靠性极佳:每天泄漏少于100毫升,只要温度不太高。PCIe拓扑同样合理。一块GPU通过ThinkPad的WWAN插槽以PCIe Gen4 x1连接,另一块使用SSD插槽以Gen2 x4连接。BIOS必须打补丁以移除硬件白名单、修改PCIe上电序列并禁用PCIe节能状态。SSD插槽技术上支持Gen4 x4,但'技术上可行'和'稳定'原来是两个不同的概念。两张3090通过NVLink连接,幸运的是,这意味着一旦推理运行起来,有疑问的主机PCIe配置就不再那么重要了。目前运行Ubuntu,通过vLLM提供Qwen3.8-27B服务,安静且速度惊人地不错。我仍在调整设置以提升性能。它还能完全不带3090启动。在这种配置下,它变成一个低空闲功耗服务器,可以在7840U上使用其64 GB共享系统RAM、Vulkan和llama.cpp运行较小的模型,非常适合我们名为Hoot的常驻Hermes机器人。但热插拔功能仍未实现。家庭推理工程的巅峰之作。
查看原文

相似文章