标签
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。
讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。
泄露的规格表明,Nvidia传闻中的50系列Super更新将使用新型3GB GDDR7模块,增加多款GPU的显存,使其对本地LLM使用更具吸引力,但价格仍令人担忧。
用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。
有用户报告称,在单个 RTX 3090 上,使用基于 Qwen 的 35B A3B 模型(占用 17 GB 显存),配合 BeeLlama.cpp 分支中的 KVarN 4-bit KV 缓存量化,成功运行了 100 万 token 的上下文,并从文本不同位置提取出 7 根针。
用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。
作者观察到Nvidia桌面级70系列GPU已经连续两代停留在12GB显存,并暗示Nvidia可能是故意限制显存,以维持对利润率更高的AI硬件需求的增长。
Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。
Poolside发布了Laguna S 2.1,用户购入了3块AMD V620 GPU,总计96 GB显存。
本指南介绍如何利用仅有6GB显存的旧Linux桌面电脑训练生成式AI底鼓音效模型,让AI音频生成在有限硬件条件下变得触手可及。
一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。
演示了如何用约100美元通过两张NVIDIA P102-100显卡实现20GB显存和448GB/s带宽,运行llama.cpp服务并搭载Qwen模型,支持3个并发用户处理大上下文。
一位用户分享了在24GB GPU上运行Qwen 3.6 27b的详细VRAM用量测量数据,展示了上下文窗口大小和余量,并指出二手RTX 3090的性能与新卡完全相同。
用户询问针对不同 VRAM 级别(8-16GB、24-32GB、128GB)的最佳本地 AI 模型推荐,提到了 Gemma4、Qwen 和 DeepSeek 变体,因为他们正在改进 Hermes 中的本地模型支持。
Discord、Steam和Telegram等应用即使在最小化时也会预留显存,总共消耗1GB以上;使用大语言模型(LLM)的用户应关闭这些应用或禁用硬件加速以释放显存。
开源的个人AI计算机搭建指南,最高支持384GB VRAM,配置涵盖家庭环境到企业内部部署。包含物料清单、组装照片以及本地运行开源AI模型的软件设置。
一位拥有64GB显存的开发者分享了他使用unsloth版Qwen 3.5 122b-a10b模型进行编码的偏好,并向社区征求推荐。