运行 gemma-4-26B-A4B 不需要 GPU
摘要
作者展示了在仅使用 CPU 的系统上,通过 Koboldcpp 高效运行 Gemma-4-26B-A4B 模型,在一台旧台式机上达到了每秒 7 个 token 的速度,这表明运行本地大语言模型推理可能并不需要强大的 GPU。
我已经在我的旧 i5-8500 土豆机(32GB 内存,\*没有 GPU\*)上运行了一段时间的 LLM,最高能跑 12B 的密集模型,虽然慢但还能用。但这款 Gemma-4-26B-A4B 在这台只有 CPU 的 Linux 机器上跑 Koboldcpp 简直是飞一样快。没错,一台花 150 美元买的旧二手台式机,就能跑出约 7 T/s 的最新一代 LLM。嘿,尽管嘲笑吧。你可以吹嘘你那比二手车还贵的超级主机,但我吹嘘的是我从 eBay 上买来的一台破旧台式机,花不到一个晚上出去玩的钱,就能跑同样的东西。我一直在考虑买块 GPU,但现在看来似乎没这个必要了。这些较小的模型在没有 GPU 的情况下表现惊人。
相似文章
在13年历史的Xeon无GPU服务器上以每秒5个token运行Gemma 4 26B
一位开发者成功在无GPU、双路Xeon的13年旧服务器上,使用修改版ik_llama.cpp(无需AVX2指令),以约每秒5个token的速度运行谷歌的Gemma 4 26B混合专家模型。
Gemma 4 E2B 在浏览器中运行,使用Fable 5编写的WebGPU内核,速度达255 tok/s
Gemma 4被演示在浏览器中通过WebGPU以每秒255个token的速度运行,使用Fable 5生成的内核,展示了高效的设备端推理。
一台10年前的Xeon就够了
一篇博客文章,详细介绍了如何仅使用CPU和DDR3内存,在10年前的Xeon服务器上运行Gemma 4 AI模型,并使用了自定义的llama.cpp优化。
@analogalok: 在8GB显存上以20+ token/秒运行Gemma 4 26B MoE,支持250k上下文。如果你有8GB显存显卡,停下你正在做的事……
Alok演示了使用Unsloth的QAT量化以及llama.cpp中的-cmoe标志,在8GB显存上运行Gemma 4 26B MoE,实现了250k上下文下20 token/秒的速度,这标志着廉价本地AI的一个重要里程碑。
@analogalok: 我刚刚在我的 RTX 4060 上用 llama.cpp + CUDA 13.2 跑了 Google 全新的 Unsloth Gemma4 12B 密集 GGUF,每秒 21 个 token…
Google 新推出的 Gemma 4 12B 是一个纯解码器 transformer,采用无编码器的多模态输入,在达到强大基准性能的同时,尺寸足够小,可以在廉价 GPU 上本地运行。它采用 Apache 2.0 许可证发布。