@analogalok: 我刚刚在我的 RTX 4060 上用 llama.cpp + CUDA 13.2 跑了 Google 全新的 Unsloth Gemma4 12B 密集 GGUF,每秒 21 个 token…

X AI KOLs Timeline 模型

摘要

Google 新推出的 Gemma 4 12B 是一个纯解码器 transformer,采用无编码器的多模态输入,在达到强大基准性能的同时,尺寸足够小,可以在廉价 GPU 上本地运行。它采用 Apache 2.0 许可证发布。

我刚刚在我的 RTX 4060 上用 llama.cpp + CUDA 13.2 跑了 Google 全新的 Unsloth Gemma4 12B 密集 GGUF 每秒 21 个 token。在廉价消费级 GPU 上。本地运行。 无需 API。无需云服务。无需订阅。 而且基准测试结果相当炸裂 # 首先说说架构,因为它确实与众不同 你用过所有的多模态模型,都是冻结的视觉编码器 + 冻结的音频编码器 + LLM 主干拼凑而成 Gemma 4 12B 则不同 它只是一个纯解码器 transformer。仅此而已。视觉?原始 48×48 像素块 → 一次矩阵乘法 → 直接投影到 LLM 中 音频?原始 16kHz 信号切片成 40ms 帧 → 线性投影 → 相同的 LLM 输入空间 没有编码器开销。没有延迟损失。没有内存碎片 为了说明编码器节省的资源: 旧的 Gemma 4 26B 方法: - 5.5 亿参数的视觉编码器(冻结) - 3 亿参数的音频编码器(冻结) - LLM 主干 Gemma 4 12B: - 3500 万参数的视觉嵌入器(一次矩阵乘法) - 完全没有音频编码器 - LLM 主干处理一切 单视觉部分就从 5.5 亿降到 3500 万。这可是 15 倍的缩减 这就是为什么 gemma-4-12b-it-Q4_K_M.gguf 只有 6.6 GB!!! 而且它原生支持 256K 上下文 # 基准测试: AIME 2026(数学奥林匹克):77.5% GPQA Diamond(专家级科学):78.8% LiveCodeBench v6(真实代码):72% Codeforces 评分:1659 MMLU Pro:77.2% MATH-Vision:79.7% BigBench Extra Hard:53% 推理 → llama.cpp, LM Studio, vLLM, SGLang llamacpp 参数: -m "gemma-4-12b-it-Q4_K_M.gguf" -ngl 99 -c 8000 -v --port 8080 现在已在 huggingface 发布!链接如下
查看原文
查看缓存全文

缓存时间: 2026/06/03 23:56

我刚刚在我的RTX 4060上用llama.cpp + CUDA 13.2跑完了Google全新的Unsloth Gemma4 12B稠密GGUF模型。
每秒21个token。一张消费级显卡。本地运行。
没有API。没有云服务。没有订阅。
而且基准测试结果简直炸裂。

先聊聊架构,这玩意儿真的与众不同

你之前用过的每个多模态模型都是把冻结的视觉编码器 + 冻结的音频编码器 + LLM主干粘在一起。

Gemma 4 12B不一样。

它就是一个纯粹的仅解码器Transformer。没错。视觉?原始48×48像素块 → 一个矩阵乘法 → 直接投射进LLM。

音频?原始16kHz信号切分成40ms帧 → 线性投影 → 进入同一个LLM输入空间。

没有编码器开销。没有延迟损失。没有内存碎片。

为了让你直观感受省掉编码器带来的好处:

老架构Gemma 4 26B:

  • 5.5亿参数的视觉编码器(冻结)
  • 3亿参数的音频编码器(冻结)
  • LLM主干

Gemma 4 12B:

  • 3500万参数的视觉嵌入器(仅一个矩阵乘法)
  • 根本没有音频编码器
  • LLM主干处理一切

仅视觉部分就从5.5亿参数降到3500万。减少了15倍。

这就是为什么gemma-4-12b-it-Q4_K_M.gguf只有6.6GB!!!

而且它原生支持256K上下文。

基准测试:

AIME 2026(数学奥赛):77.5%
GPQA Diamond(专家级科学):78.8%
LiveCodeBench v6(真实代码):72%
Codeforces ELO:1659
MMLU Pro:77.2%
MATH-Vision:79.7%
BigBench Extra Hard:53%

推理框架 → llama.cpp, LM Studio, vLLM, SGLang

llamacpp参数:

-m “gemma-4-12b-it-Q4_K_M.gguf” -ngl 99 -c 8000 -v –port 8080

现在就在Huggingface上可用!链接在下面。

Huggingface Unsloth GGUF 链接:

革命性架构。无需专用的视觉和音频编码器。

基准测试结果。

智能体编程评测与对比即将发布。

我完全不同意。基准测试只是截图,高吞吐量毫无用处,除非生成的token质量高。智能体编程评测与对比即将发布。

开源AI将获胜!

没错!智能体编程测试即将发布!敬请期待。

谢谢!

相似文章

Gemma 12b 低于10瓦 6.5pp 1.3tg

Reddit r/LocalLLaMA

在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。