注意:系统托盘中的几个聊天应用为自己预留了1GB显存。
摘要
Discord、Steam和Telegram等应用即使在最小化时也会预留显存,总共消耗1GB以上;使用大语言模型(LLM)的用户应关闭这些应用或禁用硬件加速以释放显存。
如果某个应用使用基于Web的界面并开启了“硬件加速”,它会在显存中构建帧,有时即使应用最小化也会保留这些帧。在我的Linux机器上,Discord是占用最多的,预留了450MB显存。Steam占用200MB,Telegram占用150MB,其他几个应用加起来超过1GB。如果你正在想方设法将某些内容塞进显存,请确保关闭这些应用,或者在它们的设置中关闭“硬件加速”。但这样它们会变得非常卡顿。另外,可以准备另一个关闭了硬件加速的浏览器,只在处理LLM时使用它。附注:在Linux上使用Nvidia时,我可以用命令nvidia-smi获取显存吞噬者的列表。
相似文章
llama.cpp - 如何在GPU上释放更多空间
一则讨论如何在llama.cpp中释放GPU内存实用技巧的帖子,例如将mmproj卸载到CPU、调整KV缓存类型,同时讨论了--cache-type-k/v和--spec-draft-n-max等参数。
@sudoingX: 保存这条。它回答了一个每个24GB GPU用户都会问但几乎没人答对的问题:我实际能运行多大的上下文?
一位用户分享了在24GB GPU上运行Qwen 3.6 27b的详细VRAM用量测量数据,展示了上下文窗口大小和余量,并指出二手RTX 3090的性能与新卡完全相同。
LLM的GPU内存计算 (2026版)
一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。
@sudoingX: 那些用16GB显卡的,别再滑了。@pupposandro 和 @davideciffa 把 qwen 35b-a3b 压缩到13.3GB,在……上实测
一种名为 luce spark 的技术让 Qwen 35B-a3B MoE 模型能够在16GB GPU(如RTX 3090)上运行,通过学习哪些专家被频繁使用,并将其余专家从内存流式加载,实现约100 tok/s,且不受显存瓶颈限制。
本地LLM CPU用户……你们做任何事情要花多长时间?
关于在CPU上本地运行大语言模型性能的讨论,特别是大上下文尺寸的情况,以及显存限制带来的挑战。