我把一部安卓手机改造成了支持Vulkan加速的本地大模型节点(GGUF + LiteLLM + Tailscale)
摘要
一部安卓手机被重新用作便携式GGUF推理服务器,支持Vulkan加速,并通过LiteLLM暴露兼容OpenAI的端点,借助Tailscale网格集成到自托管的AI集群中。
大家好——我一直在开发一个东西,现在终于稳定到可以分享了。我一直在尝试将Android设备作为自托管AI网格中的本地推理节点。目标不是“在Android上运行聊天机器人”,而是让手机变成一个便携式GGUF推理服务器,接入现有集群。
## 当前功能
- 在设备本地加载GGUF模型
- 使用Vulkan进行移动GPU加速
- 在网格上暴露一个兼容OpenAI的端点
- 像其他后端一样通过LiteLLM路由
- 通过Tailscale加入集群
- 支持降级路由到更大的本地节点
- 在网格其他部分不可用时可以独立运行
## 架构
```text
[Android Pocket Node / Z Fold 6] GGUF + Vulkan (gpu_layers=89) llama.cpp JNI/NDK桥接 兼容OpenAI的本地端点
↓
[Tailscale Mesh]
↓
[neo-x510uar上的边缘网关] 请求预检:电池/温度/提示长度路由
↓
[neo-x510uar上的LiteLLM路由器] 兼容OpenAI的网关、模型别名、降级路由
↓
[降级节点] sheens-mac-studio —— 较重推理/评判模型 moolah —— 用于GPU密集型任务的RTX机器
```
相似文章
我开发了一款在本地运行AI模型的安卓应用
一位开发者创建了一款在本地运行AI模型的安卓应用,支持GGUF和LiteRT格式,并提供了多种添加模型的方式。
@victormustar: 移动端300 tok/s太疯狂了... 开源必须赢
开源AI推理在移动端达到300 tok/s,借助WebGPU框架,Liquid AI的LFM2.5 230M模型在浏览器中达到1,400 tok/s。
本地 LLM 的意外应用
一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
是什么阻碍了 App 把用户设备当成服务器、本地跑 LLM?
一位用户思考为何更多 App 不在手机上直接跑本地 LLM,指出 Gemma 2-4B 模型已能离线运行,在接近 GPT-4o 质量的同时还能省掉服务器成本。