标签
react-native-executorch 库现已集成 Google 的 Gemma 4 模型,可实现完全离线的 GPU 加速推理,在 Android 上使用 Vulkan 委托,在 Apple Silicon 上使用 MLX 委托。
一位开发者通过在NVMe SSD上流式传输模型权重,在树莓派5上运行了DeepSeek-V4-Flash,达到了1.3 tokens/秒的速率,功耗仅8瓦,证明了前沿级别的开放权重模型在低成本、离线硬件上的可行性。
演示了如何使用 WebGPU 和 Transformers.js 在浏览器中离线运行 Gemma 4,并通过 WebSerial 控制 Reachy Mini 机器人。
一位用户思考为何更多 App 不在手机上直接跑本地 LLM,指出 Gemma 2-4B 模型已能离线运行,在接近 GPT-4o 质量的同时还能省掉服务器成本。