我绘制了哪些本地LLM实际上适合每个内存层级,8到128GB(开放数据集)

Reddit r/LocalLLaMA 工具

摘要

GitHub上的一个开放数据集绘制了哪些本地LLM适合不同的内存层级(8GB到128GB),提供了内存大小规则、每层模型列表和Ollama命令,并带有用于编程访问的JSON API。

我一直在为朋友们回答同一个问题(“我有一台16GB的MacBook/一张3060,我到底能运行什么?”),厌倦了猜测,所以我开始了一个电子表格。它发展成了真正的数据集,所以我把它放在GitHub上,采用CC BY许可,供任何人使用或修正。 我总结的经验法则:在Q4_K_M量化下,一个模型每十亿参数大约需要0.6GB内存,你应该将模型大小控制在RAM/VRAM的70%左右,以便为操作系统、上下文和KV缓存留出空间。 据此,每个层级的舒适上限(目前集合中有62个本地模型): 可用RAM预算 适合的最大参数量 适合的模型数 8GB ~5.6GB ~8B 23 16GB ~11GB ~14B 36 24GB ~17GB ~27B 41 32GB ~22GB ~35B 50 48GB ~34GB ~47B 53 64GB ~45GB ~70B 56 128GB ~90GB ~122B 58 完整内容(每层具体模型、量化方式、加载大小、每个模型的ollama命令,以及GPU/Mac/iPhone细分)在这里:https://github.com/Wecko-ai/modelfit-hardware-dataset 。如果你更喜欢通过编程方式获取,还有一个JSON API。 诚实的说明:tok/s数值是基于带宽的估算,并非我在每个芯片上运行的基准测试。仅供参考。覆盖范围最强的是Apple Silicon和消费级NVIDIA。AMD较新且覆盖较少。“适合”意味着它可以加载并以可用速度运行,并非“在完整上下文下适合”(长上下文会消耗更多内存)。如果看起来不对(某个应该适合但实际不适合的模型、我弄错的量化方式、缺失的显卡),请告诉我或者提交PR。这就是开放的全部意义。(全面披露:我还在其基础上构建了一个网站和CLI,modelfit.io,但数据集本身才是最有用的部分,并且是免费使用的。)
查看原文

相似文章

LLM的GPU内存计算 (2026版)

Reddit r/LocalLLaMA

一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。