我绘制了哪些本地LLM实际上适合每个内存层级,8到128GB(开放数据集)
摘要
GitHub上的一个开放数据集绘制了哪些本地LLM适合不同的内存层级(8GB到128GB),提供了内存大小规则、每层模型列表和Ollama命令,并带有用于编程访问的JSON API。
我一直在为朋友们回答同一个问题(“我有一台16GB的MacBook/一张3060,我到底能运行什么?”),厌倦了猜测,所以我开始了一个电子表格。它发展成了真正的数据集,所以我把它放在GitHub上,采用CC BY许可,供任何人使用或修正。
我总结的经验法则:在Q4_K_M量化下,一个模型每十亿参数大约需要0.6GB内存,你应该将模型大小控制在RAM/VRAM的70%左右,以便为操作系统、上下文和KV缓存留出空间。
据此,每个层级的舒适上限(目前集合中有62个本地模型): 可用RAM预算 适合的最大参数量 适合的模型数 8GB ~5.6GB ~8B 23 16GB ~11GB ~14B 36 24GB ~17GB ~27B 41 32GB ~22GB ~35B 50 48GB ~34GB ~47B 53 64GB ~45GB ~70B 56 128GB ~90GB ~122B 58
完整内容(每层具体模型、量化方式、加载大小、每个模型的ollama命令,以及GPU/Mac/iPhone细分)在这里:https://github.com/Wecko-ai/modelfit-hardware-dataset 。如果你更喜欢通过编程方式获取,还有一个JSON API。
诚实的说明:tok/s数值是基于带宽的估算,并非我在每个芯片上运行的基准测试。仅供参考。覆盖范围最强的是Apple Silicon和消费级NVIDIA。AMD较新且覆盖较少。“适合”意味着它可以加载并以可用速度运行,并非“在完整上下文下适合”(长上下文会消耗更多内存)。如果看起来不对(某个应该适合但实际不适合的模型、我弄错的量化方式、缺失的显卡),请告诉我或者提交PR。这就是开放的全部意义。(全面披露:我还在其基础上构建了一个网站和CLI,modelfit.io,但数据集本身才是最有用的部分,并且是免费使用的。)
相似文章
@oliviscusAI: 有人刚刚开发了一款工具,可以准确告诉你哪些大语言模型可以在你的硬件上运行。它会扫描你的内存、CPU 和 GPU……
一款新工具已发布,它通过扫描用户的硬件规格(内存、CPU、GPU)来确定哪些大语言模型可以本地运行,并根据性能指标对这些模型进行排名。
打造了一款能准确告诉你哪些LLMs适合你的GPU的工具。欢迎反馈。
一款估算哪些LLMs适合用户GPU内存的工具,根据性能对模型进行排名,同时考虑内存限制和量化级别。
LLM的GPU内存计算 (2026版)
一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。
为本地LLM提供大量答案的新旧基准测试
本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。
@akshay_pachaar:谷歌刚刚发布了一款新LLM!你只需8GB内存就能在本地运行。让我们用自己的数据来微调它(完全本地运行…
谷歌发布了一款新LLM,只需8GB内存即可在本地运行。推文展示了如何在本地利用个人数据对其进行微调。