@googlegemma: 我们正在推出对 Gemma 4 的一些重大改进,这得益于社区提供的惊人反馈和贡献!以下是……
摘要
Google Gemma 正在推出对 Gemma 4 的重大改进,这些改进源于社区的反馈和贡献,详情参见一条推文串。
查看缓存全文
缓存时间: 2026/07/16 14:19
我们正基于社区出色的反馈与贡献,对 Gemma 4 进行一系列重大改进!
以下是本次更新修复和升级的详细内容:
Flash Attention:我们已在 NVIDIA Hopper GPU 上启用统一的 Flash Attention 4(FA4)支持!
预计预填充吞吐量将提升 25-70%,首 Token 生成时间(TTFT)最多下降 31%。(2/5)
聊天模板:更流畅的对话格式。
工具调用:修复了相关问题,实现准确、一致的工具执行。(3/5)
视觉选项:想让 Gemma 看得更清楚?
默认视觉桶为 280,以提升 Token 效率。如需捕捉最大细节(如清晰的 OCR 和 2.51MP 分辨率),请手动将 max_soft_tokens 提高到 1120!
试试我们新的交互式 Space,了解其工作原理:https://huggingface.co/spaces/google/gemma4_vision_token_budget…
减少懒惰:我们大幅减少了模型在边缘情况下有所保留或回答过短的问题,从而输出更完整的回答。(4/5)
衷心感谢社区提交修复方案并不断探索让 Gemma 变得更好的新方法。没有你们,我们无法做到!
准备好体验速度提升了吗?立即从 Hugging Face 下载最新的 Gemma 4 更新:https://huggingface.co/collections/google/gemma-4…(5/5)
相似文章
Google 正在更新 Gemma 4 的聊天模板,大幅修复工具调用并减少“惰性”,在 Hopper GPU 上启用 Flash Attention 4,同时提供关于如何操作及改进其视觉能力的交互式指南!
Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。
与Gemma 4 31B对话!
宣布推出Gemma 4 31B,这是谷歌的一款新的大型语言模型。
你想要新的Gemma吗?
关于Google Gemma模型新版本的预告或询问,暗示即将发布。
@googlegemma: Gemma 4 在手机上速度提升 3 倍!看看推测解码带来的不同!Multi-Token Predi…
Google 的 Gemma 4 通过推测解码和多 Token 预测,推理速度提升高达 3 倍,可实现高效的设备端部署。
@lmstudio: Gemma 4 12B 来了!一款紧凑的中型 Gemma 模型,可直接在你的笔记本上运行——由 @google 以 Apache 2.0 许可证发布…
Google 发布了 Gemma 4 12B,这是一款紧凑的中型模型,可在笔记本上运行,采用 Apache 2.0 许可证,现在已在 LM Studio 中可用。