@sudoingX: 那些用16GB显卡的,别再滑了。@pupposandro 和 @davideciffa 把 qwen 35b-a3b 压缩到13.3GB,在……上实测
摘要
一种名为 luce spark 的技术让 Qwen 35B-a3B MoE 模型能够在16GB GPU(如RTX 3090)上运行,通过学习哪些专家被频繁使用,并将其余专家从内存流式加载,实现约100 tok/s,且不受显存瓶颈限制。
查看缓存全文
缓存时间: 2026/06/11 17:43
使用16GB显卡的朋友,先别划走。@pupposandro 和 @davideciffa 成功将 Qwen 35B-A3B 模型压缩到13.3GB,并在3090 GPU上实测运行。
这意味着之前根本装不下的模型,现在不仅能装下,还能以约100 tok/s的速度运行,接近24GB显卡上所有专家驻留时的表现。
巧妙之处在于很多人都没搞懂MoE的关键:每次token只激活约30亿(35B中的3B)参数,从256个专家中路由到8个左右——但为了应对后续请求,你仍然需要把所有专家都留在显存里。
Luce Spark能学习你的流量实际命中了哪些专家,把热门专家固定在显存,其余专家则隐藏在矩阵乘法操作背后从RAM中流式加载,从而避免速度断崖。只需一个标志位,每次重启它都会自动调优,让热专家更“热”。
这类工作能让整个本地推理层级降低一张显卡。别让它从你眼前溜走。
相似文章
在16GB显存+32GB内存下运行Qwen 3.8 - 写给贫民窟GPU玩家的实用/趣味指南
一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。
Qwen 35B-A3B 在 12GB 显存下非常可用。
一位用户在12GB的RTX 3060上对Qwen 35B-A3B(一个35B参数的MoE模型)进行了基准测试,发现12GB显存是运行该模型并支持32k上下文时的实用甜点区,生成速度可达约47 token/秒。
@sudoingX: 保存这条。它回答了一个每个24GB GPU用户都会问但几乎没人答对的问题:我实际能运行多大的上下文?
一位用户分享了在24GB GPU上运行Qwen 3.6 27b的详细VRAM用量测量数据,展示了上下文窗口大小和余量,并指出二手RTX 3090的性能与新卡完全相同。
@rohanpaul_ai: 精美的视觉展示,有人在本地运行 Qwen 3.8 27B,使用 RTX 5090 32 GB 显存系统,速度达到 115 tokens/秒 注意,Qw…
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型
Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。