运行 gemma-4-26B-A4B 不需要 GPU

Reddit r/LocalLLaMA 模型

摘要

作者展示了在仅使用 CPU 的系统上,通过 Koboldcpp 高效运行 Gemma-4-26B-A4B 模型,在一台旧台式机上达到了每秒 7 个 token 的速度,这表明运行本地大语言模型推理可能并不需要强大的 GPU。

我已经在我的旧 i5-8500 土豆机(32GB 内存,\*没有 GPU\*)上运行了一段时间的 LLM,最高能跑 12B 的密集模型,虽然慢但还能用。但这款 Gemma-4-26B-A4B 在这台只有 CPU 的 Linux 机器上跑 Koboldcpp 简直是飞一样快。没错,一台花 150 美元买的旧二手台式机,就能跑出约 7 T/s 的最新一代 LLM。嘿,尽管嘲笑吧。你可以吹嘘你那比二手车还贵的超级主机,但我吹嘘的是我从 eBay 上买来的一台破旧台式机,花不到一个晚上出去玩的钱,就能跑同样的东西。我一直在考虑买块 GPU,但现在看来似乎没这个必要了。这些较小的模型在没有 GPU 的情况下表现惊人。
查看原文

相似文章

一台10年前的Xeon就够了

Hacker News Top

一篇博客文章,详细介绍了如何仅使用CPU和DDR3内存,在10年前的Xeon服务器上运行Gemma 4 AI模型,并使用了自定义的llama.cpp优化。