Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
摘要
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
我一直在用 Anthropic 和 OpenAI,持续了将近一年,之前试过一次 ollama——速度慢得要命——我就彻底放弃了本地模型。但看来情况已经变了。上周末我淘了一台带 3090 的二手游戏主机。昨天我部署了 qwen 3.6:35b-a3b。我下载了压缩到 20GB 的版本(batiai/qwen3.6-35b:iq4),正好能塞进 3090 的显存。当模型还在系统内存里跑时,输出速度就已经有每秒 15 个 token,还算不错;但等我把模型全部装进显存后,输出速度直接飙到了每秒 160 个 token。接着我给它喂了一张图片。https://preview.redd.it/cmpali41ev4h1.png?width=1882&format=png&auto=webp&s=a4c7732b9820730cc3f38b604ee04d465d7cc86e 视频处理花了 75 秒,但是……哇哦。真的太厉害了。在五年前的老显卡上本地运行就能达到这种效果!你们大概已经习以为常了,但确实让我大开眼界!而且我们同时还在用 Plex 播放一个转码的电影!我终于明白你们为什么这么喜欢 3090 了——真是一张神卡。
相似文章
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。
@rohanpaul_ai: 精美的视觉展示,有人在本地运行 Qwen 3.8 27B,使用 RTX 5090 32 GB 显存系统,速度达到 115 tokens/秒 注意,Qw…
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
@ItsmeAjayKV: 3090 更新:现在使用 Qwen 3.6-35b-a3b MoE (q6_k_xl)。首次突破 90 t/s,尚未启用 MTP,预填充速度…
用户报告使用 llama.cpp 在 RTX 3090 上运行 Qwen 3.6-35b-a3b MoE 模型,实现了超过 90 tokens/s 的推理速度,预填充速度超过 1000 t/s,表明在消费级硬件上本地部署大型语言模型是可行的。