@analogalok: 我刚刚在我的 RTX 4060 上用 llama.cpp + CUDA 13.2 跑了 Google 全新的 Unsloth Gemma4 12B 密集 GGUF,每秒 21 个 token…
摘要
Google 新推出的 Gemma 4 12B 是一个纯解码器 transformer,采用无编码器的多模态输入,在达到强大基准性能的同时,尺寸足够小,可以在廉价 GPU 上本地运行。它采用 Apache 2.0 许可证发布。
查看缓存全文
缓存时间: 2026/06/03 23:56
我刚刚在我的RTX 4060上用llama.cpp + CUDA 13.2跑完了Google全新的Unsloth Gemma4 12B稠密GGUF模型。
每秒21个token。一张消费级显卡。本地运行。
没有API。没有云服务。没有订阅。
而且基准测试结果简直炸裂。
先聊聊架构,这玩意儿真的与众不同
你之前用过的每个多模态模型都是把冻结的视觉编码器 + 冻结的音频编码器 + LLM主干粘在一起。
Gemma 4 12B不一样。
它就是一个纯粹的仅解码器Transformer。没错。视觉?原始48×48像素块 → 一个矩阵乘法 → 直接投射进LLM。
音频?原始16kHz信号切分成40ms帧 → 线性投影 → 进入同一个LLM输入空间。
没有编码器开销。没有延迟损失。没有内存碎片。
为了让你直观感受省掉编码器带来的好处:
老架构Gemma 4 26B:
- 5.5亿参数的视觉编码器(冻结)
- 3亿参数的音频编码器(冻结)
- LLM主干
Gemma 4 12B:
- 3500万参数的视觉嵌入器(仅一个矩阵乘法)
- 根本没有音频编码器
- LLM主干处理一切
仅视觉部分就从5.5亿参数降到3500万。减少了15倍。
这就是为什么gemma-4-12b-it-Q4_K_M.gguf只有6.6GB!!!
而且它原生支持256K上下文。
基准测试:
AIME 2026(数学奥赛):77.5%
GPQA Diamond(专家级科学):78.8%
LiveCodeBench v6(真实代码):72%
Codeforces ELO:1659
MMLU Pro:77.2%
MATH-Vision:79.7%
BigBench Extra Hard:53%
推理框架 → llama.cpp, LM Studio, vLLM, SGLang
llamacpp参数:
-m “gemma-4-12b-it-Q4_K_M.gguf” -ngl 99 -c 8000 -v –port 8080
现在就在Huggingface上可用!链接在下面。
Huggingface Unsloth GGUF 链接:
革命性架构。无需专用的视觉和音频编码器。
基准测试结果。
智能体编程评测与对比即将发布。
我完全不同意。基准测试只是截图,高吞吐量毫无用处,除非生成的token质量高。智能体编程评测与对比即将发布。
开源AI将获胜!
没错!智能体编程测试即将发布!敬请期待。
谢谢!
相似文章
昨天在我的3090上跑了gemma 4 12b,我觉得本地模型领域已经变了
一位用户报告称,通过GGUF量化在单张RTX 3090上本地运行了谷歌的Gemma 4 12B模型,发现其性能强劲,包括真实的256k上下文、多模态能力以及函数调用功能,在编码任务上甚至优于更大的70B模型。
Gemma 12b 低于10瓦 6.5pp 1.3tg
在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。
@UnslothAI:Gemma 4 12B 现在可以通过 Dynamic GGUFs 在仅 8GB 内存上本地运行。Google 的新模型 Gemma 4 12B Unified 支持图像…
Gemma 4 12B,Google 的多模态开放模型,支持图像、音频和 256K 上下文,现在可以通过 Unsloth 的 Dynamic GGUFs 在仅 8GB 内存上本地运行,并通过 Unsloth Studio 实现本地训练和推理。
全新Google Gemma 4 12B自称性能接近26B模型——我们实测了这两款!
Google全新Gemma 4 12B模型宣称性能接近26B模型。在RTX 4090的本地测试中,26B-A4B模型更快且表现更佳,但12B模型显存占用更少,适合笔记本电脑使用。
在13年历史的Xeon无GPU服务器上以每秒5个token运行Gemma 4 26B
一位开发者成功在无GPU、双路Xeon的13年旧服务器上,使用修改版ik_llama.cpp(无需AVX2指令),以约每秒5个token的速度运行谷歌的Gemma 4 26B混合专家模型。