在 RTX Pro 6000 上使用 Ninfer 对 Qwen3.6 35ba3b 进行单请求达到 600 tokens/s。还记得 Comcast 的广告 "stupid fast" 吗?

Reddit r/LocalLLaMA 新闻

摘要

在 RTX Pro 6000 上使用 Ninfer 在 Qwen3.6 模型上达到每秒600 tokens,尽管不是最先进的模型,但适用于暴力任务。

虽然不是最聪明的,但它是我的新苦工模型,用于阅读+查找或编码任务,我愿意让它暴力执行。即使令牌数量是20倍,这仍然比许多本地模型更快。虽然不及 Cerebras,但使用起来还是挺有趣的。
查看原文

相似文章