标签
一位开发者报告称,使用 Unsloth 的 GGUF 模型时,Gemma 4 的多模态功能在较新的 llama.cpp 构建中被破坏,原因是不兼容的 mmproj 文件。切换到 ggml-org 的官方模型后问题立即解决,这凸显了第三方量化器与 llama.cpp 更新之间反复出现的兼容性问题。
作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。
TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。
用户分享了他们对 Gemma 4 26b A4b 的积极体验,称赞其速度、多模态能力以及强大的语言能力(尤其在德语方面),同时指出尽管在代理和编码性能上不及 Qwen,但能很好地处理各种任务。
在AMD 6800H iGPU上使用llama.cpp Vulkan后端对Gemma 4和Qwen 3.6 MoE模型进行的基准测试表明,MoE模型和低位量化(Q4_0)提供了最佳性能,而Q8_0对于大型模型来说速度太慢。
对HuggingFace上23个Gemma 4 E4B模型的对比显示,下载最多的模型OBLITERATUS完全坏掉了,而更精细的'heretic'变体表现最佳。
谷歌的 Gemma 4 26B A4B 模型可通过模型分页在 iPhone 17 Pro 上运行,实现强大的设备端 AI 功能。
在M5 Pro上使用llama.cpp本地测试了更新后的Gemma 4,使用OpenCode进行编码任务时达到60 tokens/s;后端表现良好,但UI/UX不佳。
Cactus Hybrid是一款经过后训练的Gemma 4模型,可输出置信度分数,支持在设备端进行推理,并在置信度较低时路由至更大模型,以最少的大模型调用实现了与Gemini 3.1 Flash-Lite相当的性能。
DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。
Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。
用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。
分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。
MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。
Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。
Google Gemma 正在推出对 Gemma 4 的重大改进,这些改进源于社区的反馈和贡献,详情参见一条推文串。
一个将融合操作拆分为两个矩阵乘法的修复方案,使 Gemma 4 能在使用了 13 年的双路 Xeon CPU 上以每秒 5.2 token 的速度运行,每次 token 仅使用 26B 权重中的 4B。
一位开发者成功在无GPU、双路Xeon的13年旧服务器上,使用修改版ik_llama.cpp(无需AVX2指令),以约每秒5个token的速度运行谷歌的Gemma 4 26B混合专家模型。