昨天在我的3090上跑了gemma 4 12b,我觉得本地模型领域已经变了
摘要
一位用户报告称,通过GGUF量化在单张RTX 3090上本地运行了谷歌的Gemma 4 12B模型,发现其性能强劲,包括真实的256k上下文、多模态能力以及函数调用功能,在编码任务上甚至优于更大的70B模型。
发布后大约两小时我就跑起了gguf量化版本,我真的没想到一个12b模型能有这样的表现。多模态功能确实有效,我给它喂了代码库的截图,它解析架构的能力比我测试过的大多数70b模型都要好。256k上下文窗口是真实的,而且它不会像llama模型在超过32k时那样在边缘失效。我把整个代码仓库载入上下文,它能跟踪整个代码库中的引用。单张3090配合q4量化,运行速度大约每秒15个token,对开发工作来说完全可用。让我惊讶的是它的规模范围。12b模型处在一个甜区,你无需多GPU就能获得强大的推理能力。我在16GB内存的笔记本上试了e4b版本,速度较慢但功能齐全。我已经把它换入了我的本地编码流程。函数调用支持意味着我可以把它接入我的工具链,而无需之前那些蹩脚的变通方法。12b上的原生音频输入我还没尝试过,但这对语音驱动工作流程的潜在影响简直不可思议。
相似文章
@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…
DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。
RTX5090, gemma-4-31B-it-Q6_K.gguf。上下文:之前 - 35k,之后 - 80k!
在RTX 5090上运行量化后的Gemma-4-31B模型,上下文长度从35k增加到80k,展示了显著的性能提升。
全新Google Gemma 4 12B自称性能接近26B模型——我们实测了这两款!
Google全新Gemma 4 12B模型宣称性能接近26B模型。在RTX 4090的本地测试中,26B-A4B模型更快且表现更佳,但12B模型显存占用更少,适合笔记本电脑使用。
@analogalok: 我刚刚在我的 RTX 4060 上用 llama.cpp + CUDA 13.2 跑了 Google 全新的 Unsloth Gemma4 12B 密集 GGUF,每秒 21 个 token…
Google 新推出的 Gemma 4 12B 是一个纯解码器 transformer,采用无编码器的多模态输入,在达到强大基准性能的同时,尺寸足够小,可以在廉价 GPU 上本地运行。它采用 Apache 2.0 许可证发布。
@leopardracer: GEMMA 4 26B 在 RTX 4060 上运行,拥有 248K Token 上下文窗口,每秒 20 个 Token,上下文窗口大得可以……
Gemma 4 26B 在 RTX 4060 上运行,通过 llama.cpp 和 Q4_K_XL 量化实现 248K Token 上下文和每秒 20 Token 的速度,从而在消费级硬件上本地处理整个代码库。