注意:系统托盘中的几个聊天应用为自己预留了1GB显存。

Reddit r/LocalLLaMA 新闻

摘要

Discord、Steam和Telegram等应用即使在最小化时也会预留显存,总共消耗1GB以上;使用大语言模型(LLM)的用户应关闭这些应用或禁用硬件加速以释放显存。

如果某个应用使用基于Web的界面并开启了“硬件加速”,它会在显存中构建帧,有时即使应用最小化也会保留这些帧。在我的Linux机器上,Discord是占用最多的,预留了450MB显存。Steam占用200MB,Telegram占用150MB,其他几个应用加起来超过1GB。如果你正在想方设法将某些内容塞进显存,请确保关闭这些应用,或者在它们的设置中关闭“硬件加速”。但这样它们会变得非常卡顿。另外,可以准备另一个关闭了硬件加速的浏览器,只在处理LLM时使用它。附注:在Linux上使用Nvidia时,我可以用命令nvidia-smi获取显存吞噬者的列表。
查看原文

相似文章

llama.cpp - 如何在GPU上释放更多空间

Reddit r/LocalLLaMA

一则讨论如何在llama.cpp中释放GPU内存实用技巧的帖子,例如将mmproj卸载到CPU、调整KV缓存类型,同时讨论了--cache-type-k/v和--spec-draft-n-max等参数。

LLM的GPU内存计算 (2026版)

Reddit r/LocalLLaMA

一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。