Qwen 30B MoE - 30tps - 6GB显存 - 搞定!

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了在RTX 3050 6GB上成功运行Qwen 30B MoE的经验,支持90k上下文,速度达到每秒30-35个token,庆祝低端硬件的出色表现。

那么,我一直梦想着用我的RTX 3050 6GB版在不错的上下文窗口下达到每秒17个token,而Hermes需要超过60k上下文。当时希望凭借22GB的DDR4内存,能分出一些专家(expert)来给上下文腾出空间。结果呢?每秒10个或更少的token。😄 今天可不行!!今天我居然能用90k上下文运行它,配合Hermes达到了20-25 tps。换个框架后甚至跑出了30-35 tps 🥳🥳🥳 不是基准测试——而是真实的会话生成,带上下文,实实在在干活 😄😄😄 我稍后会编辑帖子补充细节。只是想和那些像我一样用着平民配置的朋友分享这份喜悦 😅 也许性能更好的人也能分享一下正能量。先说到这儿,干杯 🙋🏾‍♂️
查看原文

相似文章

Qwen 35B-A3B 在 12GB 显存下非常可用。

Reddit r/LocalLLaMA

一位用户在12GB的RTX 3060上对Qwen 35B-A3B(一个35B参数的MoE模型)进行了基准测试,发现12GB显存是运行该模型并支持32k上下文时的实用甜点区,生成速度可达约47 token/秒。

4x RTX 3090 上的 Qwen3.5-27B、Qwen3.5-122B 和 Qwen3.6-35B —— MoE 模型在严格全局规则下的表现困境

Reddit r/LocalLLaMA

潜水多年的老用户,首次发帖。在 4 张 RTX 3090 上对三款 Qwen 模型分别进行了 20 多个会话的实时智能体工作测试——**Qwen3.5-27B** 稠密模型、**Qwen3.5-122B-A10B** MoE 和 **Qwen3.6-35B-A3B** MoE。以下数据均解析自持续真实负载下的 vLLM 日志,而非合成基准测试。**本文所有数据的关键负载背景:** 测试框架是一个多智能体编排器,同时运行 1-6 个并发的 OpenCode 会话,Prompt 长度为 30-60k token,并且强制执行**严格的 Bash 允许列表

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。