标签
Gemma 团队将于8月20日举办线下活动,庆祝 Gemma 模型即将突破10亿下载量,届时将有现场演示和开放模型社区成员参与。
一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。
Scotoma-2 是 Gemma-4-31B-it 的更新微调版本,通过有针对性的偏好训练减少了重复性写作毛病,同时保留了基础模型的智能。它并非无审查,但旨在为角色扮演生成更干净、更不恼人的文本。
有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。
一位独立开发者更新了 AttnRes 项目:用基于注意力的路由替代标准残差流,通过渐进式切换计划和 top-K logits 从 Gemma 4 31b 进行蒸馏,并计划推出一个 Apache 2.0 社区模型。
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
VIDRAFT 团队分享了他们在 Fast Gemma 挑战赛中使用的已验证的最先进推理优化配方,在单个 A10G 上使用完全公开的基于 vLLM 的配置,实现了 510.58 TPS,PPL 为 2.39。
谷歌DeepMind的新论文SkillSmith将前缀键值缓存视为一种输入模态,在推理时把文本知识与现有权重组合成冻结的Gemma 3 4B模型的新前缀缓存,从而无需针对特定目标的训练运行即可改进适应能力。
一位用户让一个小型LLM(Gemma4-31b)在笔记本电脑上运行了将近一天,用来分析 r/LocalLLaMA,结论是出色的开放权重研究确实存在,但被基准测试闹剧和硬件炫耀所掩盖。
一份通过调整n_max参数来优化MTP(多令牌预测)性能的指南,附带了多种模型(如Gemma-31b和Qwen)在P100和V100 GPU上的基准测试结果。
这项预注册研究测试了和乐(一种几何度量)是否集中在Gemma 2 2B语言模型的主动SAE特征平面上。与语义集中预测相反,主动特征平面比匹配的混合特征控制平面携带更少的和乐,导致了一个狭窄的操作性反转,其根本原因仍然未知。
作者讲述了使用Gemma模型翻译推理痕迹时遇到的问题,模型执行了文本中的指令而非进行翻译,突出了指令与有效负载之间的边界失效。
Google Developer Experts在Sonoma Raceway使用Antigravity、Gemini和Gemma(在Pixel 10上)部署了AI Race Coach,以100英里/小时的速度提供瞬间遥测指导,展示面向高风险环境的可信赖AI。
Gemma-4-26B-a4B采用更新的聊天模板,在微调后的指令模式和推理效率上优于Qwen3.6-MoE和Qwen3.5-MoE。
一项对 Gemma 密集模型(31B)与 MoE 模型(26B)的实际基准测试显示,MoE 模型每次查询速度快 25.5%,成本低 20%,且质量相同,验证了理论上的成本节约。
Sundar Pichai 提醒大家,Google 是建立在开源之上的,并将同样的理念应用于 AI,Gemma 模型专为边缘设备设计,同时指出前沿模型需要巨大的资本投入。