巅峰便携式个人数据中心
摘要
一位用户展示了为运行Qwen3.8-27B-BF16模型而搭建的便携式个人数据中心,详细介绍了其硬件配置、性能基准测试以及针对高上下文长度AI推理的散热管理方案。
我这套用于运行 Qwen3.8-27B-BF16 模型的便携设备,可处理超200K token的提示词。我的工作用松下Toughbook加固笔记本 + FormD T1机箱 + 电源适配器 + 耳机,全部都能装进我的午餐盒里。选用BF16是为了处理超长上下文、高敏感度文档的OCR识别、图像分析、信息聚合与总结。经过大量测试,我发现在需要法律级精度时,BF16相比UD Q8_K_XL量化版本确实有显著优势。在完整262K上下文+MMPROJ模式下,77GB显存能够暴力碾压预填充阶段(速度达1.1715 tok/sec,处理175K token仅需102秒)。但由于BF16格式的特性,尽管GPU性能强悍,生成阶段(输出20K token)的速度相对较慢,仅45 tok/sec(启用MTP加速)。不过这仍优于Gemini Pro和ChatGPT 5.6 Sol,尤其考虑到我可以完全控制采样参数(温度0.1;top-k 0;top-p 0.95;min-p 0.05;重复惩罚1.02)。但整体表现尚不及Opus模型。
预填充阶段:CPU约60°C,GPU约79°C(功率限制90%)
生成阶段:CPU约75°C,GPU约76°C
硬件配置:
FormD T1机箱
Minisforum BD770i SE主板
AMD Ryzen 7745HX八核笔记本CPU
96GB DDR5 5200MHz SODIMM内存
RTX Pro 6000 Blackwell工作站版显卡(96GB显存)
Loki 1200W SFX-L电源
ROG Equalizer 12V-2x6转接线
SMX Heinz倒装GPU 2.5槽套件
SMX Heinz定制短PCIe 5.0延长线
ZCOOI定制“透明紫”特氟龙线缆(2根)
Phanteks T30 120mm风扇(1个)
Noctua NF-A14x25r G2 14cm风扇
利民MC-3 Digital内存散热器(注:此散热器可能不兼容普通DDR5内存条)
相似文章
Qwen3.6 35B-A3B在笔记本上的运行:我的从零到一时刻
作者分享了在ASUS Zenbook Pro 14上本地运行Qwen3.6 35B-A3B的体验,在32k上下文下实现了27 TPS的生成速度,标志着向完全本地化AI以保护隐私的个人里程碑。
@0xZenad: 这是Perplexity便携式计算机中重要的部分:完全本地化Qwen:59.6% 本地化Qwen + Opus 5仅在需要时…
Perplexity在NVIDIA DGX Spark上推出便携式计算机,提供完全本地化的AI执行,支持Qwen和Opus 5等模型,当使用Opus 5处理所有任务时,性能最高可达82.4%。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
数据中心的未来是便携式的吗?Runware 打造了一个模块化数据中心来寻找答案
Runware 宣布推出 Sonic Inference Pod,这是一种面向 AI 推理的便携式模块化数据中心,旨在相比传统数据中心提供更低的成本、更快的部署和灵活的扩展。
你计划如何在本地运行 Qwen3.8-2.4T-A95B?
一个社区帖,询问爱好者们计划如何在本地运行大型 Qwen3.8-2.4T-A95B 模型,并分享在个人硬件上运行巨大 AI 模型的挣扎。