gemma-4

标签

Cards List
#gemma-4

Unsloth 的 Gemma 4 mmproj 在新版 llama.cpp 构建中悄然破坏了视觉与音频功能——还有人遇到这个问题吗?

Reddit r/LocalLLaMA · 2天前

一位开发者报告称,使用 Unsloth 的 GGUF 模型时,Gemma 4 的多模态功能在较新的 llama.cpp 构建中被破坏,原因是不兼容的 mmproj 文件。切换到 ggml-org 的官方模型后问题立即解决,这凸显了第三方量化器与 llama.cpp 更新之间反复出现的兼容性问题。

0 人收藏 0 人点赞
#gemma-4

在 500MB 内存上运行 Gemma 4

Reddit r/LocalLLaMA · 4天前

讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。

0 人收藏 0 人点赞
#gemma-4

是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA · 2026-07-31

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

0 人收藏 0 人点赞
#gemma-4

Show HN:开源引擎,可在任何M系列Mac上用2GB内存运行Gemma 4 26B

Hacker News Top · 2026-07-29 缓存

TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。

0 人收藏 0 人点赞
#gemma-4

对 Gemma 4 26b A4b 的赞赏

Reddit r/LocalLLaMA · 2026-07-28

用户分享了他们对 Gemma 4 26b A4b 的积极体验,称赞其速度、多模态能力以及强大的语言能力(尤其在德语方面),同时指出尽管在代理和编码性能上不及 Qwen,但能很好地处理各种任务。

0 人收藏 0 人点赞
#gemma-4

在AMD 6800H(iGPU/UMA)上测试Gemma 4和Qwen 3.6 MoE——性能解析

Reddit r/LocalLLaMA · 2026-07-27

在AMD 6800H iGPU上使用llama.cpp Vulkan后端对Gemma 4和Qwen 3.6 MoE模型进行的基准测试表明,MoE模型和低位量化(Q4_0)提供了最佳性能,而Q8_0对于大型模型来说速度太慢。

0 人收藏 0 人点赞
#gemma-4

23个Gemma4-E4B模型通过abliterlitics对比:下载最多的那个也是最差的

Reddit r/LocalLLaMA · 2026-07-26

对HuggingFace上23个Gemma 4 E4B模型的对比显示,下载最多的模型OBLITERATUS完全坏掉了,而更精细的'heretic'变体表现最佳。

0 人收藏 0 人点赞
#gemma-4

Gemma 4 26B A4B 通过模型分页在 iPhone 17 Pro 上运行

Reddit r/LocalLLaMA · 2026-07-24

谷歌的 Gemma 4 26B A4B 模型可通过模型分页在 iPhone 17 Pro 上运行,实现强大的设备端 AI 功能。

0 人收藏 0 人点赞
#gemma-4

本地测试(更新后的)Gemma 4在OpenCode中的编码表现

Reddit r/LocalLLaMA · 2026-07-23

在M5 Pro上使用llama.cpp本地测试了更新后的Gemma 4,使用OpenCode进行编码任务时达到60 tokens/s;后端表现良好,但UI/UX不佳。

0 人收藏 0 人点赞
#gemma-4

Cactus Hybrid: 我们教会了Gemma 4识别自己的错误

Reddit r/LocalLLaMA · 2026-07-22

谷歌的Gemma 4模型已被增强,能够识别自己何时出错,从而提高了其校准和可靠性。

0 人收藏 0 人点赞
#gemma-4

Show HN: Cactus Hybrid: 我们教会了Gemma 4识别自身错误

Hacker News Top · 2026-07-22 缓存

Cactus Hybrid是一款经过后训练的Gemma 4模型,可输出置信度分数,支持在设备端进行推理,并在置信度较低时路由至更大模型,以最少的大模型调用实现了与Gemini 3.1 Flash-Lite相当的性能。

0 人收藏 0 人点赞
#gemma-4

@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…

X AI KOLs Timeline · 2026-07-21 缓存

DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。

0 人收藏 0 人点赞
#gemma-4

@googlegemma: 无需等待的语音AI!感谢Hugging Face和Cerebras,开发者现在可以用Gemma 4 31B模型作为……

X AI KOLs Timeline · 2026-07-20 缓存

Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。

0 人收藏 0 人点赞
#gemma-4

Gemma 4 仍然偷懒

Reddit r/LocalLLaMA · 2026-07-20

用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。

0 人收藏 0 人点赞
#gemma-4

@no_stp_on_snek: 你实际上不是在评测模型,而是在评测它的模板。我测试了每个版本的 Gemma 4,以观察其在压力下的行为表现……

X AI KOLs Following · 2026-07-18 缓存

分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。

0 人收藏 0 人点赞
#gemma-4

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#gemma-4

Google 正在更新 Gemma 4 的聊天模板,大幅修复工具调用并减少“惰性”,在 Hopper GPU 上启用 Flash Attention 4,同时提供关于如何操作及改进其视觉能力的交互式指南!

Reddit r/LocalLLaMA · 2026-07-15 缓存

Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。

0 人收藏 0 人点赞
#gemma-4

@googlegemma: 我们正在推出对 Gemma 4 的一些重大改进,这得益于社区提供的惊人反馈和贡献!以下是……

X AI KOLs Timeline · 2026-07-15 缓存

Google Gemma 正在推出对 Gemma 4 的重大改进,这些改进源于社区的反馈和贡献,详情参见一条推文串。

0 人收藏 0 人点赞
#gemma-4

@sakurayukiai: Gemma 4 每次 token 只激活约 4B 的 26B 权重,因此修复方案出奇地简单:将一个不支持的融合操作拆分为两个……

X AI KOLs Timeline · 2026-07-15

一个将融合操作拆分为两个矩阵乘法的修复方案,使 Gemma 4 能在使用了 13 年的双路 Xeon CPU 上以每秒 5.2 token 的速度运行,每次 token 仅使用 26B 权重中的 4B。

0 人收藏 0 人点赞
#gemma-4

在13年历史的Xeon无GPU服务器上以每秒5个token运行Gemma 4 26B

Hacker News Top · 2026-07-15 缓存

一位开发者成功在无GPU、双路Xeon的13年旧服务器上,使用修改版ik_llama.cpp(无需AVX2指令),以约每秒5个token的速度运行谷歌的Gemma 4 26B混合专家模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈