一个用于本地LLM的"能跑吗"计算器(考虑量化与KV缓存)
摘要
一个网络工具,通过考虑量化、KV缓存和VRAM开销,计算给定本地LLM能否在指定硬件上运行,并提供预估速度和内存使用。
如果你运行本地模型,你会知道尝试判断一个新模型是否会立即导致你的设置OOM(内存溢出)是多么头疼,尤其是当你开始尝试不同量化方式和巨大上下文窗口时。Can My PC Run It? Local AI Checker on TheAITechPulse,这是一个非常方便的工具,可以帮助你消除本地部署中的猜测。以下是你可以配置的内容:硬件:它覆盖了当前广泛的硬件,从较老的RTX 3060到最新的RTX 5090,以及Radeon显卡和Apple Silicon(最高到M4/M5 Max和M2 Ultra)。模型:它更新到最近发布的模型,包括DeepSeek V3、Llama 3.3 70B、Llama 4 Scout和Qwen 2.5。变量:你可以选择量化(从Q4到未压缩的FP16)和所需的上下文窗口(从8k到128k tokens)。实质(如何计算):它不是给出任意建议,而是展示其计算过程。VRAM:通过参数数量 × 量化字节 + KV缓存(基于上下文大小) + 约0.6 GB开销计算得出。速度:通过(内存带宽 × 约70%效率)÷ 活动模型权重大小估算得出。(当然,这取决于你使用Ollama、llama.cpp还是vLLM而略有变化)。如果你想弄清楚是否能在你的设备上以Q4运行一个70B模型,或者想确切知道128k上下文窗口在DeepSeek上会消耗多少VRAM,这个工具能帮你省去大量手算。工具链接在此:Can My PC Run It? 希望这能帮助一些人避免一些内存溢出错误!
相似文章
@oliviscusAI: 有人刚刚开发了一款工具,可以准确告诉你哪些大语言模型可以在你的硬件上运行。它会扫描你的内存、CPU 和 GPU……
一款新工具已发布,它通过扫描用户的硬件规格(内存、CPU、GPU)来确定哪些大语言模型可以本地运行,并根据性能指标对这些模型进行排名。
LLM的GPU内存计算 (2026版)
一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。
打造了一款能准确告诉你哪些LLMs适合你的GPU的工具。欢迎反馈。
一款估算哪些LLMs适合用户GPU内存的工具,根据性能对模型进行排名,同时考虑内存限制和量化级别。
(又一个)KV 缓存计算器 - kvanta.vcerny.cz
一款名为 KVANTA 的新开源 KV 缓存计算器工具已发布,支持来自 Hugging Face 的任何 LLM/VLM。
@Michaelzsguo: 发现了一个对你的本地LLM推理优化很有用的工具:https://kvcache.ai/tools/kv-cache-ca…
一条推文分享了来自KVCache.ai的KV缓存大小计算器,这是一个用于估算本地LLM推理中KV缓存内存使用量的工具,并强调DeepSeek V4 Pro的100万token仅使用5GB内存。