@googlegemma: 我们正在推出对 Gemma 4 的一些重大改进,这得益于社区提供的惊人反馈和贡献!以下是……

X AI KOLs Timeline 模型

摘要

Google Gemma 正在推出对 Gemma 4 的重大改进,这些改进源于社区的反馈和贡献,详情参见一条推文串。

我们正在推出对 Gemma 4 的一些重大改进,这得益于社区提供的惊人反馈和贡献! 以下是本次版本修复和更新的详细说明:🧵👇 https://t.co/SMIGbJaUZg
查看原文
查看缓存全文

缓存时间: 2026/07/16 14:19

我们正基于社区出色的反馈与贡献,对 Gemma 4 进行一系列重大改进!

以下是本次更新修复和升级的详细内容:

Flash Attention:我们已在 NVIDIA Hopper GPU 上启用统一的 Flash Attention 4(FA4)支持!

预计预填充吞吐量将提升 25-70%,首 Token 生成时间(TTFT)最多下降 31%。(2/5)

聊天模板:更流畅的对话格式。

工具调用:修复了相关问题,实现准确、一致的工具执行。(3/5)

视觉选项:想让 Gemma 看得更清楚?

默认视觉桶为 280,以提升 Token 效率。如需捕捉最大细节(如清晰的 OCR 和 2.51MP 分辨率),请手动将 max_soft_tokens 提高到 1120!

试试我们新的交互式 Space,了解其工作原理:https://huggingface.co/spaces/google/gemma4_vision_token_budget…

减少懒惰:我们大幅减少了模型在边缘情况下有所保留或回答过短的问题,从而输出更完整的回答。(4/5)

衷心感谢社区提交修复方案并不断探索让 Gemma 变得更好的新方法。没有你们,我们无法做到!

准备好体验速度提升了吗?立即从 Hugging Face 下载最新的 Gemma 4 更新:https://huggingface.co/collections/google/gemma-4…(5/5)

相似文章

与Gemma 4 31B对话!

Reddit r/LocalLLaMA

宣布推出Gemma 4 31B,这是谷歌的一款新的大型语言模型。