我把一部安卓手机改造成了支持Vulkan加速的本地大模型节点(GGUF + LiteLLM + Tailscale)
摘要
一部安卓手机被重新用作便携式GGUF推理服务器,支持Vulkan加速,并通过LiteLLM暴露兼容OpenAI的端点,借助Tailscale网格集成到自托管的AI集群中。
大家好——我一直在开发一个东西,现在终于稳定到可以分享了。我一直在尝试将Android设备作为自托管AI网格中的本地推理节点。目标不是“在Android上运行聊天机器人”,而是让手机变成一个便携式GGUF推理服务器,接入现有集群。
## 当前功能
- 在设备本地加载GGUF模型
- 使用Vulkan进行移动GPU加速
- 在网格上暴露一个兼容OpenAI的端点
- 像其他后端一样通过LiteLLM路由
- 通过Tailscale加入集群
- 支持降级路由到更大的本地节点
- 在网格其他部分不可用时可以独立运行
## 架构
```text
[Android Pocket Node / Z Fold 6] GGUF + Vulkan (gpu_layers=89) llama.cpp JNI/NDK桥接 兼容OpenAI的本地端点
↓
[Tailscale Mesh]
↓
[neo-x510uar上的边缘网关] 请求预检:电池/温度/提示长度路由
↓
[neo-x510uar上的LiteLLM路由器] 兼容OpenAI的网关、模型别名、降级路由
↓
[降级节点] sheens-mac-studio —— 较重推理/评判模型 moolah —— 用于GPU密集型任务的RTX机器
```
相似文章
我开发了一款在本地运行AI模型的安卓应用
一位开发者创建了一款在本地运行AI模型的安卓应用,支持GGUF和LiteRT格式,并提供了多种添加模型的方式。
@TheTechDiggest:[开源 - 分布式AI与网格LLM推理] 购买昂贵的企业级GPU并不是运行大规模……的唯一方式
一条推文线程介绍了mesh-llm,这是一个开源工具,可将本地网络设备汇聚成一个统一的、兼容OpenAI的API,无需昂贵的企业级GPU即可运行大型LLM。
本地 LLM 的意外应用
一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
是什么阻碍了 App 把用户设备当成服务器、本地跑 LLM?
一位用户思考为何更多 App 不在手机上直接跑本地 LLM,指出 Gemma 2-4B 模型已能离线运行,在接近 GPT-4o 质量的同时还能省掉服务器成本。