我把一部安卓手机改造成了支持Vulkan加速的本地大模型节点(GGUF + LiteLLM + Tailscale)

Reddit r/LocalLLaMA 工具

摘要

一部安卓手机被重新用作便携式GGUF推理服务器,支持Vulkan加速,并通过LiteLLM暴露兼容OpenAI的端点,借助Tailscale网格集成到自托管的AI集群中。

大家好——我一直在开发一个东西,现在终于稳定到可以分享了。我一直在尝试将Android设备作为自托管AI网格中的本地推理节点。目标不是“在Android上运行聊天机器人”,而是让手机变成一个便携式GGUF推理服务器,接入现有集群。 ## 当前功能 - 在设备本地加载GGUF模型 - 使用Vulkan进行移动GPU加速 - 在网格上暴露一个兼容OpenAI的端点 - 像其他后端一样通过LiteLLM路由 - 通过Tailscale加入集群 - 支持降级路由到更大的本地节点 - 在网格其他部分不可用时可以独立运行 ## 架构 ```text [Android Pocket Node / Z Fold 6] GGUF + Vulkan (gpu_layers=89) llama.cpp JNI/NDK桥接 兼容OpenAI的本地端点 ↓ [Tailscale Mesh] ↓ [neo-x510uar上的边缘网关] 请求预检:电池/温度/提示长度路由 ↓ [neo-x510uar上的LiteLLM路由器] 兼容OpenAI的网关、模型别名、降级路由 ↓ [降级节点] sheens-mac-studio —— 较重推理/评判模型 moolah —— 用于GPU密集型任务的RTX机器 ```
查看原文

相似文章

本地 LLM 的意外应用

Reddit r/LocalLLaMA

一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。