一个用于本地LLM的"能跑吗"计算器(考虑量化与KV缓存)

Reddit r/ArtificialInteligence 工具

摘要

一个网络工具,通过考虑量化、KV缓存和VRAM开销,计算给定本地LLM能否在指定硬件上运行,并提供预估速度和内存使用。

如果你运行本地模型,你会知道尝试判断一个新模型是否会立即导致你的设置OOM(内存溢出)是多么头疼,尤其是当你开始尝试不同量化方式和巨大上下文窗口时。Can My PC Run It? Local AI Checker on TheAITechPulse,这是一个非常方便的工具,可以帮助你消除本地部署中的猜测。以下是你可以配置的内容:硬件:它覆盖了当前广泛的硬件,从较老的RTX 3060到最新的RTX 5090,以及Radeon显卡和Apple Silicon(最高到M4/M5 Max和M2 Ultra)。模型:它更新到最近发布的模型,包括DeepSeek V3、Llama 3.3 70B、Llama 4 Scout和Qwen 2.5。变量:你可以选择量化(从Q4到未压缩的FP16)和所需的上下文窗口(从8k到128k tokens)。实质(如何计算):它不是给出任意建议,而是展示其计算过程。VRAM:通过参数数量 × 量化字节 + KV缓存(基于上下文大小) + 约0.6 GB开销计算得出。速度:通过(内存带宽 × 约70%效率)÷ 活动模型权重大小估算得出。(当然,这取决于你使用Ollama、llama.cpp还是vLLM而略有变化)。如果你想弄清楚是否能在你的设备上以Q4运行一个70B模型,或者想确切知道128k上下文窗口在DeepSeek上会消耗多少VRAM,这个工具能帮你省去大量手算。工具链接在此:Can My PC Run It? 希望这能帮助一些人避免一些内存溢出错误!
查看原文

相似文章

LLM的GPU内存计算 (2026版)

Reddit r/LocalLLaMA

一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。