vram

标签

Cards List
#vram

@rohanpaul_ai: 精美的视觉展示,有人在本地运行 Qwen 3.8 27B,使用 RTX 5090 32 GB 显存系统,速度达到 115 tokens/秒 注意,Qw…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。

0 人收藏 0 人点赞
#vram

梦想是达到200GB VRAM

Reddit r/LocalLLaMA ↗ · 2026-08-16

用户概述了一个逐步计划,通过在自定义PC构建中组合多个NVIDIA GPU来实现200GB VRAM,涉及购买、安装和电源管理。

0 人收藏 0 人点赞
#vram

这里有多少人拥有24GB以上的GPU?

Reddit r/LocalLLaMA ↗ · 2026-08-16

作者基于下载次数讨论了qwen 3.8 27b模型的低采用率,并估计很少有用户拥有用于高效本地LLM开发的高显存GPU。

0 人收藏 0 人点赞
#vram

我实测了 CMP170HX

Reddit r/LocalLLaMA ↗ · 2026-08-11

对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。

0 人收藏 0 人点赞
#vram

12GB显存的小伙伴们,我们的计划是什么?

Reddit r/LocalLLaMA ↗ · 2026-08-11

讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。

0 人收藏 0 人点赞
#vram

传闻中的50系列Super更新将各型号显存提升50%

Reddit r/LocalLLaMA ↗ · 2026-08-11

泄露的规格表明,Nvidia传闻中的50系列Super更新将使用新型3GB GDDR7模块,增加多款GPU的显存,使其对本地LLM使用更具吸引力,但价格仍令人担忧。

0 人收藏 0 人点赞
#vram

Muse Glimmer 居然真的能装进单张 RTX 3090

Reddit r/LocalLLaMA ↗ · 2026-08-10

用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。

0 人收藏 0 人点赞
#vram

24 GB 显存跑 170 亿参数模型 + 1M 上下文:"第一次成功加载近 100 万 token 上下文,并提取出文本各处的 7 根针"

Reddit r/LocalLLaMA ↗ · 2026-08-10

有用户报告称,在单个 RTX 3090 上,使用基于 Qwen 的 35B A3B 模型(占用 17 GB 显存),配合 BeeLlama.cpp 分支中的 KVarN 4-bit KV 缓存量化,成功运行了 100 万 token 的上下文,并从文本不同位置提取出 7 根针。

0 人收藏 0 人点赞
#vram

Deepseek V4 Flash 刚刚登陆 Colibri,有人有性能数据吗?

Reddit r/LocalLLaMA ↗ · 2026-08-05

用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。

0 人收藏 0 人点赞
#vram

70级显存停滞不前

Reddit r/LocalLLaMA ↗ · 2026-08-03

作者观察到Nvidia桌面级70系列GPU已经连续两代停留在12GB显存,并暗示Nvidia可能是故意限制显存,以维持对利润率更高的AI硬件需求的增长。

0 人收藏 0 人点赞
#vram

Unsloth的Daniel Han验证Qwen3.8-27B仅需17GB显存即可运行

Reddit r/LocalLLaMA ↗ · 2026-08-03

Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。

0 人收藏 0 人点赞
#vram

今天Poolside发布Laguna S 2.1真是完美时机,因为我刚入手了这些!终于有还算不错的显存了。3块V620 = 96 GB。

Reddit r/LocalLLaMA ↗ · 2026-07-22

Poolside发布了Laguna S 2.1,用户购入了3块AMD V620 GPU,总计96 GB显存。

0 人收藏 0 人点赞
#vram

如何在仅有6GB显存的旧Linux桌面电脑上训练生成式AI底鼓模型

Hacker News Top ↗ · 2026-07-16

本指南介绍如何利用仅有6GB显存的旧Linux桌面电脑训练生成式AI底鼓音效模型,让AI音频生成在有限硬件条件下变得触手可及。

0 人收藏 0 人点赞
#vram

@brianbellx: 我在不对模型做任何改变的情况下,从 GLM-5.2 中移除了 423 GB。1,403 GB → 980 GB。753B 权重。逐比特精确。无需量化…

X AI KOLs Timeline ↗ · 2026-07-12 缓存

一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。

0 人收藏 0 人点赞
#vram

超低成本20GB显存,448GB/s带宽,仅需100美元。

Reddit r/LocalLLaMA ↗ · 2026-07-11

演示了如何用约100美元通过两张NVIDIA P102-100显卡实现20GB显存和448GB/s带宽,运行llama.cpp服务并搭载Qwen模型,支持3个并发用户处理大上下文。

0 人收藏 0 人点赞
#vram

@sudoingX: 保存这条。它回答了一个每个24GB GPU用户都会问但几乎没人答对的问题:我实际能运行多大的上下文?

X AI KOLs Timeline ↗ · 2026-07-11 缓存

一位用户分享了在24GB GPU上运行Qwen 3.6 27b的详细VRAM用量测量数据,展示了上下文窗口大小和余量,并指出二手RTX 3090的性能与新卡完全相同。

0 人收藏 0 人点赞
#vram

@theemozilla: 我们正在努力改善 Hermes 中的本地模型体验,每个参数量级的最佳本地模型是什么?

X AI KOLs Timeline ↗ · 2026-07-10 缓存

用户询问针对不同 VRAM 级别(8-16GB、24-32GB、128GB)的最佳本地 AI 模型推荐,提到了 Gemma4、Qwen 和 DeepSeek 变体,因为他们正在改进 Hermes 中的本地模型支持。

0 人收藏 0 人点赞
#vram

注意:系统托盘中的几个聊天应用为自己预留了1GB显存。

Reddit r/LocalLLaMA ↗ · 2026-07-03

Discord、Steam和Telegram等应用即使在最小化时也会预留显存,总共消耗1GB以上;使用大语言模型(LLM)的用户应关闭这些应用或禁用硬件加速以释放显存。

0 人收藏 0 人点赞
#vram

@tom_doerr:最高可达384GB VRAM的个人AI计算机搭建指南 https://github.com/autonomous-ai/autonomous-computer…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

开源的个人AI计算机搭建指南,最高支持384GB VRAM,配置涵盖家庭环境到企业内部部署。包含物料清单、组装照片以及本地运行开源AI模型的软件设置。

0 人收藏 0 人点赞
#vram

开发们 - 你有64GB显存 - 你用什么模型写代码?

Reddit r/LocalLLaMA ↗ · 2026-06-30

一位拥有64GB显存的开发者分享了他使用unsloth版Qwen 3.5 122b-a10b模型进行编码的偏好,并向社区征求推荐。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈