@h100envy:谷歌工程师详解如何在手机上用21分钟将小型LLM从46%准确率微调至90% - 比…
摘要
一位谷歌工程师分享了在手机上用21分钟将Gemma 270M模型从46%准确率微调至90%的方法,使用合成数据、LoRA、int4量化,离线可达每秒2000 tokens。
查看缓存全文
缓存时间: 2026/07/16 18:21
谷歌工程师解释道:如何用21分钟在手机上将一个微型LLM的准确率从46%微调至90%——比1500美元的设备端AI训练营效果更好。
选择Gemma 270M → 生成合成任务数据 → 通过LoRA微调 → 量化至int4 → 部署到Pixel上,实现每秒2000个token。
这个循环就是让一个270M模型在你的任务上击败70B模型的关键,完全离线运行在你的口袋里。
Gemma 270M + 合成数据 + LoRA + int4量化 + 设备端运行时——这就是整个技术栈。
观看并保存它,然后今晚就微调你自己的小型智能体。
相似文章
@TeksEdge:我对谷歌 Gemma 4 技术报告最惊讶的是,他们通过大量……进行了极其激进的优化
对谷歌 Gemma 4 技术报告的评论,指出他们通过量化感知训练(QAT)和多令牌预测(MTP)进行了激进的优化,以实现更快的推理。
@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…
Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。
Gemma 12b 低于10瓦 6.5pp 1.3tg
在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。
@googlegemma: Gemma 4 在手机上速度提升 3 倍!看看推测解码带来的不同!Multi-Token Predi…
Google 的 Gemma 4 通过推测解码和多 Token 预测,推理速度提升高达 3 倍,可实现高效的设备端部署。
Gemma 4 QAT模型:为移动和笔记本电脑效率优化压缩
谷歌发布采用量化感知训练(QAT)优化的Gemma 4模型,旨在提升移动和笔记本电脑部署的效率,将E2B模型的内存占用降至1GB,同时保持质量。