Android Studio 原生支持 Gemma 4 在 llama.cpp 上运行
摘要
Android Studio 现在原生支持使用 llama.cpp 运行 Gemma 4 AI 模型,具有多 GPU 支持和 128k 上下文长度等功能。
https://preview.redd.it/6e9xb57a42nh1.png?width=787&format=png&auto=webp&s=ffae7996bbf8ab00498cc62c733e7597dc550f24 我不确定有多少人关心 Android Studio,但我认为 Google 使用 llama.cpp 很酷。我猜它是 Vulkan 和 Gemma 4 的 QAT 版本。它支持多 GPU,31B 模型的最大上下文长度为 128k。完全加载时使用 34 GB 显存。我没有看到更改上下文长度或显示 PP/TG 速度的选项。
相似文章
谷歌的 Gemma 4 12B 刚刚发布 —— 下面教你如何在 Mac 上本地运行它
Google 发布了 Gemma 4 12B,这是一款基于 Apache 2.0 开源协议的多模态模型,支持文本、视觉和音频处理,上下文窗口达 256K。本文提供了一份指南,介绍如何在 Mac 上使用 Ollama、LM Studio 或 llama.cpp 本地运行该模型。
@googlegemma: Gemma 4 现在可以使用 React Native 在设备端运行!你现在可以在跨平台应用中完全离线运行 Gemma 4,并支持……
Gemma 4 现在可以使用 React Native 在设备端完全离线运行,通过 Android 上的 Vulkan 和 Apple Silicon 上的 MLX 实现本地硬件加速,支持视觉和工具使用能力,例如阅读传单和安排日程,完全在设备端完成。
Gemma 4 + LiteRT-LM在移动设备上:内存和性能远优于我的llama.cpp设置
用户分享在移动设备上运行Gemma 4与LiteRT-LM的亲身对比体验,相较于之前的llama.cpp设置,内存占用显著降低(1.5-2 GB vs 4-5 GB),推理速度更快(2-4秒 vs 7-10秒),测试机型包括三星S25 Ultra和iPhone 13 Pro Max。
@analogalok: gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。对基于 Fable 5 推理训练的模型进行了智能体升级。运行…
Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。
@lmstudio: Gemma 4 12B 来了!一款紧凑的中型 Gemma 模型,可直接在你的笔记本上运行——由 @google 以 Apache 2.0 许可证发布…
Google 发布了 Gemma 4 12B,这是一款紧凑的中型模型,可在笔记本上运行,采用 Apache 2.0 许可证,现在已在 LM Studio 中可用。