巅峰便携式个人数据中心

Reddit r/LocalLLaMA 新闻

摘要

一位用户展示了为运行Qwen3.8-27B-BF16模型而搭建的便携式个人数据中心,详细介绍了其硬件配置、性能基准测试以及针对高上下文长度AI推理的散热管理方案。

我这套用于运行 Qwen3.8-27B-BF16 模型的便携设备,可处理超200K token的提示词。我的工作用松下Toughbook加固笔记本 + FormD T1机箱 + 电源适配器 + 耳机,全部都能装进我的午餐盒里。选用BF16是为了处理超长上下文、高敏感度文档的OCR识别、图像分析、信息聚合与总结。经过大量测试,我发现在需要法律级精度时,BF16相比UD Q8_K_XL量化版本确实有显著优势。在完整262K上下文+MMPROJ模式下,77GB显存能够暴力碾压预填充阶段(速度达1.1715 tok/sec,处理175K token仅需102秒)。但由于BF16格式的特性,尽管GPU性能强悍,生成阶段(输出20K token)的速度相对较慢,仅45 tok/sec(启用MTP加速)。不过这仍优于Gemini Pro和ChatGPT 5.6 Sol,尤其考虑到我可以完全控制采样参数(温度0.1;top-k 0;top-p 0.95;min-p 0.05;重复惩罚1.02)。但整体表现尚不及Opus模型。 预填充阶段:CPU约60°C,GPU约79°C(功率限制90%) 生成阶段:CPU约75°C,GPU约76°C 硬件配置: FormD T1机箱 Minisforum BD770i SE主板 AMD Ryzen 7745HX八核笔记本CPU 96GB DDR5 5200MHz SODIMM内存 RTX Pro 6000 Blackwell工作站版显卡(96GB显存) Loki 1200W SFX-L电源 ROG Equalizer 12V-2x6转接线 SMX Heinz倒装GPU 2.5槽套件 SMX Heinz定制短PCIe 5.0延长线 ZCOOI定制“透明紫”特氟龙线缆(2根) Phanteks T30 120mm风扇(1个) Noctua NF-A14x25r G2 14cm风扇 利民MC-3 Digital内存散热器(注:此散热器可能不兼容普通DDR5内存条)
查看原文

相似文章