Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial 模型

摘要

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。

我一直在用 Anthropic 和 OpenAI,持续了将近一年,之前试过一次 ollama——速度慢得要命——我就彻底放弃了本地模型。但看来情况已经变了。上周末我淘了一台带 3090 的二手游戏主机。昨天我部署了 qwen 3.6:35b-a3b。我下载了压缩到 20GB 的版本(batiai/qwen3.6-35b:iq4),正好能塞进 3090 的显存。当模型还在系统内存里跑时,输出速度就已经有每秒 15 个 token,还算不错;但等我把模型全部装进显存后,输出速度直接飙到了每秒 160 个 token。接着我给它喂了一张图片。https://preview.redd.it/cmpali41ev4h1.png?width=1882&format=png&auto=webp&s=a4c7732b9820730cc3f38b604ee04d465d7cc86e 视频处理花了 75 秒,但是……哇哦。真的太厉害了。在五年前的老显卡上本地运行就能达到这种效果!你们大概已经习以为常了,但确实让我大开眼界!而且我们同时还在用 Plex 播放一个转码的电影!我终于明白你们为什么这么喜欢 3090 了——真是一张神卡。
查看原文

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。