@tunguz: 看到这些推文后,我决定在我那台装有 RTX 1070 GPU 的老旧 Ubuntu 电脑上试试(就是那台我刚刚……
摘要
一位用户报告成功在较老的 RTX 1070 GPU 上本地运行 Qwen3 8B,展示了现代大语言模型在十年前的硬件上也能表现出不错的性能。
查看缓存全文
缓存时间: 2026/05/29 05:37
看到这些推文后,我决定在自己那台装有 RTX 1070 GPU 的老旧 Ubuntu 电脑上试试(就是前几天刚从 16.04 一路升级到 24.04 的那台)。让 Mac 上的 Codex 连接到那台机器,安装并测试 qwen3 8b。到目前为止确实 https://t.co/Vnc1a5XRd5
Sudo su (@sudoingX): 好吧这太疯狂了。一块 10 年前的 GTX 1080 8GB Pascal 显卡,通过 Hermes Agent 在本地以 18-20 tok/s 运行 qwen3 8b,而且还真的能干活。
让它构建一个包含 10 个测试的 Wireworld 细胞自动机模拟器。全自主运行,没有手把手指导。本以为会在……失败
相似文章
@cyrilXBT: 太不可思议了。Qwen 3.8 27B 现在在本地 RTX 4060 上仅用 8GB 显存就能愉快运行。你看到的这是一个 64k 上下文…
一位用户分享称,Qwen 3.8 27B 模型通过 Unsloth 的 IQ4_XS 量化,在仅有 8GB 显存的 RTX 4060 上本地运行,实现了 64k 上下文窗口和令人印象深刻的性能指标。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
试了 Qwen3.6-27B-UD-Q6_K_XL.gguf 配 CloudeCode,真不敢相信居然能用
用户报告称,在 RTX 5090 本地运行 Qwen3-27B-UD-Q6_K_XL.gguf,200K 上下文速度约 50 tok/s,编码表现出乎意料地可用,标志着本地模型质量大幅跃升。
@ItsmeAjayKV: 成就解锁:得益于RTX 3090,现在我可以运行Qwen3.6-27b密集模型。正在运行 @Alibaba_Qwen Qwen 3…
用户使用llama.cpp在RTX 3090上对Qwen3.6-27B进行基准测试,实现了35 tok/s的生成速度和1247 tok/s的提示处理速度。
@cniongolo: 我不确定大家是否已经意识到,你实际上可以在双 GPU 上运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF…
演示了在双路 Nvidia RTX PRO 6000 Blackwell GPU 上,使用 Hugging Face Inference 运行自定义 Qwen 模型(Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF),达到每秒约 195 个 token 的处理速度。