@_philschmid:我们刚刚发布了 Gemma 4 12B!这是我们首个具备原生音频输入的中型模型。Gemma 4 12B 是一个统一的、无需编码器的多模态模型。
摘要
我们刚刚发布了 Gemma 4 12B,一个中型多模态模型,支持原生音频输入,仅需 16GB 内存,并以 Apache 2.0 许可证发布。
我们刚刚发布了 Gemma 4 12B!这是我们首个具备原生音频输入的中型模型。Gemma 4 12B 是一个统一的、无需编码器的多模态模型。
🧠 视觉和音频直接接入 LLM。
💻 仅需 16GB 内存。
📊 基准测试接近 26B。
📄 Apache 2.0。https://t.co/o7sKQBHoWx
查看缓存全文
缓存时间: 2026/06/03 17:53
我们刚刚发布了 Gemma 4 12B!这是我们首个支持原生音频输入的中型模型。Gemma 4 12B 是一款统一的无编码器多模态模型。
🧠 视觉与音频直连 LLM。 💻 仅需 16GB 内存即可运行。 📊 基准测试逼近 26B 模型。 📄 采用 Apache 2.0 许可。https://t.co/o7sKQBHoWx
相似文章
@googleaidevs: 我们正在发布Gemma 4 12B:这是一款统一的、无编码器的模型,将强大的多模态智能直接带到您的笔记本电脑上。
Google发布Gemma 4 12B,一款原生支持音频、无编码器的多模态模型,专为在笔记本电脑上本地运行而优化,采用Apache 2.0许可证。
推出 Gemma 4 12B:一个统一的、无编码器的多模态模型
Google DeepMind 宣布推出 Gemma 4 12B,一种新颖的无编码器多模态 AI 模型,将视觉和音频直接集成到 LLM 主干中,在配备 16GB RAM 的笔记本电脑上提供高级推理和代理能力,以 Apache 2.0 许可证发布。
@osanseviero:非常激动地介绍 Gemma 4 12B!- 多模态:支持音频、图像、视频和文本输入 - 新颖架构:我们移除了多模态编码器…
介绍 Gemma 4 12B,一款多模态模型,支持音频、图像、视频和文本输入,采用新颖的统一架构,以及由 LiteRT 驱动的新款 MacOS 桌面应用。
@_philschmid: 我们昨天发布了 Gemma 4 12B。这里有一份详细解析其完整架构的可视化指南。→ 编码器通常如何…
一份解析 Gemma 4 12B 完整架构的可视化指南,介绍了该模型如何在移除传统视觉和音频编码器的情况下,无需独立编码器模型即可处理文本、图像和音频。
@lmstudio: Gemma 4 12B 来了!一款紧凑的中型 Gemma 模型,可直接在你的笔记本上运行——由 @google 以 Apache 2.0 许可证发布…
Google 发布了 Gemma 4 12B,这是一款紧凑的中型模型,可在笔记本上运行,采用 Apache 2.0 许可证,现在已在 LM Studio 中可用。