Android Studio 原生支持 Gemma 4 在 llama.cpp 上运行

Reddit r/LocalLLaMA 新闻

摘要

Android Studio 现在原生支持使用 llama.cpp 运行 Gemma 4 AI 模型,具有多 GPU 支持和 128k 上下文长度等功能。

https://preview.redd.it/6e9xb57a42nh1.png?width=787&format=png&auto=webp&s=ffae7996bbf8ab00498cc62c733e7597dc550f24 我不确定有多少人关心 Android Studio,但我认为 Google 使用 llama.cpp 很酷。我猜它是 Vulkan 和 Gemma 4 的 QAT 版本。它支持多 GPU,31B 模型的最大上下文长度为 128k。完全加载时使用 34 GB 显存。我没有看到更改上下文长度或显示 PP/TG 速度的选项。
查看原文

相似文章