一个完全本地的模型,甚至在您的智能手机上!
摘要
发布了一个接口,用于管理两个在智能手机上本地运行的小模型(4B 和 1.7B)。4B 在高端手机上运行良好;1.7B 在推理时存在稳定性问题,正在通过深度微调进行改进,使用 130k 示例并从 32B 教师模型中进行蒸馏。
我想告诉您,我已经发布了一个用于管理两个小模型的接口,它们甚至可以在智能手机上运行。目前,4B 运行得非常好(但需要高端手机)。我在 1.7B 上遇到一些问题,无法在启用推理时保持稳定,但我应该能够通过深度微调来解决,这耗费了我大量时间和计算能力(我的敌人不是损失函数,而是示例的质量和多样性,大约有 130,000 个!!)。我正在使用一个 32B 模型作为教师,然后蒸馏到小模型上。一旦数据集准备好(大约 10 天),我希望也能改进 1.7B,而无需像现在这样使用任何 LoRa。请像往常一样毫不留情!😘 https://nothumanallowed.com/local
相似文章
一个本地的、100%私有的语言模型,就在你的手机上!!
一个本地且私有的语言模型(Qwen 3 的 1.5B 和 4B 量化版本)可以在智能手机上离线运行,附带从 32B 模型蒸馏而来的微调与 LoRA。
100%本地模型,就在你的智能手机上!
一位开发者分享了成功微调Qwen 3模型(1.5B和4B)用于智能手机本地使用的经验,附带可下载的离线APK,并计划推出Windows版本。
2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行
Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。
让一个4B本地模型真正发挥作用:设备端“记忆助手”背后的distill-on-idle流水线
描述了一种'distill-on-idle'流水线,它使得一个4B参数的本地模型能够作为设备端记忆助手有效运行,展示了小型模型的实际应用。
@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…
Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。