一个完全本地的模型,甚至在您的智能手机上!
摘要
发布了一个接口,用于管理两个在智能手机上本地运行的小模型(4B 和 1.7B)。4B 在高端手机上运行良好;1.7B 在推理时存在稳定性问题,正在通过深度微调进行改进,使用 130k 示例并从 32B 教师模型中进行蒸馏。
我想告诉您,我已经发布了一个用于管理两个小模型的接口,它们甚至可以在智能手机上运行。目前,4B 运行得非常好(但需要高端手机)。我在 1.7B 上遇到一些问题,无法在启用推理时保持稳定,但我应该能够通过深度微调来解决,这耗费了我大量时间和计算能力(我的敌人不是损失函数,而是示例的质量和多样性,大约有 130,000 个!!)。我正在使用一个 32B 模型作为教师,然后蒸馏到小模型上。一旦数据集准备好(大约 10 天),我希望也能改进 1.7B,而无需像现在这样使用任何 LoRa。请像往常一样毫不留情!😘 https://nothumanallowed.com/local
相似文章
一个本地的、100%私有的语言模型,就在你的手机上!!
一个本地且私有的语言模型(Qwen 3 的 1.5B 和 4B 量化版本)可以在智能手机上离线运行,附带从 32B 模型蒸馏而来的微调与 LoRA。
100%本地模型,就在你的智能手机上!
一位开发者分享了成功微调Qwen 3模型(1.5B和4B)用于智能手机本地使用的经验,附带可下载的离线APK,并计划推出Windows版本。
让一个4B本地模型真正发挥作用:设备端“记忆助手”背后的distill-on-idle流水线
描述了一种'distill-on-idle'流水线,它使得一个4B参数的本地模型能够作为设备端记忆助手有效运行,展示了小型模型的实际应用。
@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…
Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。
@AdinaYakup: MiniCPM V4.6 一个真正能在手机上运行的 1B 多模态大语言模型,由 @OpenBMB 刚刚发布 1B - Apache2.0 支持 iOS、Android,…
OpenBMB 发布了 MiniCPM V4.6,这是一个专为移动设备优化的 1B 参数多模态大语言模型,采用 Apache 2.0 许可证。它具备混合视觉 token 压缩功能,声称在 iOS、Android 和 HarmonyOS 上原生运行时,吞吐量比 Qwen3.5 0.8B 快约 1.5 倍。