@cniongolo: 我不确定大家是否已经意识到,你实际上可以在双 GPU 上运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF…

X AI KOLs Following 模型

摘要

演示了在双路 Nvidia RTX PRO 6000 Blackwell GPU 上,使用 Hugging Face Inference 运行自定义 Qwen 模型(Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF),达到每秒约 195 个 token 的处理速度。

我不确定大家是否已经意识到,你实际上可以在双 GPU 设置中使用 Nvidia RTX PRO 6000 Blackwell 显卡运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF,并且仍然能在 @huggingface 上使用 huggingface Inference 达到每秒约 195 个 token 的速度! 我已经用 pi agent 试过了! @julien_c
查看原文
查看缓存全文

缓存时间: 2026/06/09 10:46

我不知道人们是否已经意识到,你其实可以在双GPU配置(使用Nvidia RTX PRO 6000 Blackwell显卡)上运行Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF,并且通过@huggingface 上的Hugging Face推理能达到大约每秒195个token!我已经用pi agent试过了! @julien_c

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。