我们真的都能搞定,对吧?双3090配置。
摘要
一位用户分享了他们搭建双3090 GPU系统以本地运行Qwen 3.6 27b模型的经验,在切换到Ubuntu并使用带有自定义补丁的club-3090工具后,实现了超过100 tokens/秒的速度。他们对本地AI的未来感到兴奋。
我完全被震撼了。之前看到有人发帖提到了“club-3090”,在让Sonnet给它打了一些补丁(特别是修复了SSE会话断开bug和工具调用bug)之后,可以公平地说,即使像我这样的“预算”配置,很快也能走上纯本地AI的道路。参考GitHub:https://github.com/noonghunna/club-3090(不是我的项目)。
最初我在WSL2上运行它。公平地说,它比LM Studio“好一些”,但还不够好。t/s只有30左右,pp大约400……我索性在本机上安装了Ubuntu双系统(我只是不太习惯无头Linux,更喜欢Windows RDP),然后……哇!我现在能达到约4000 pp/s和113 tk/s,而且没有NVLink。据说NVLink会让它更快……
无论如何,我对这个本地AI的新未来感到非常兴奋。跑在48GB显存上的Qwen 3.6 27b模型(上下文262K)感觉几乎达到了Sonnet的水平,而且比云端快得多!也很实用!我让它写了一些猴子补丁,效果非常好,还做了一些相当有用的代码审查。现在正在尝试让它处理我Linux电脑上的SSH会话。
好奇接下来能怎么升级。我之前考虑过M5 Ultra 512GB + 4x DGX Sparks(提示处理速度),但现在我在想,未来12个月里,我们是否能在更小的模型上达到前沿级别的智能(可能只在特定领域)?太棒了!
相似文章
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
@malikwas1f:在 2× RTX 3090 上聚合吞吐量 308 tok/s — 无 NVLink,Qwen3.8-27B 在 vLLM 上运行,32 个并发流。足够支撑一整个集群……
一份性能报告和指南,介绍如何在双 RTX 3090 GPU 上使用 vLLM 运行 Qwen3.8-27B 模型,实现每秒 308 个令牌的吞吐量,支持 32 个并发流,并提供 GitHub 仓库用于本地部署配置。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。