@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…
摘要
Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。
查看缓存全文
缓存时间: 2026/05/18 08:29
在设备端运行小模型的可能性太大了。
这里 @adrgrondin 在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。 大约 40tk/s,使用针对 Apple Silicon 优化的 MLX。 在移动端拥有 128K 上下文,具备顶尖的编码和数学能力。完全离线,带思考模式。 https://t.co/sPK65qc7Bd
相似文章
@rohanpaul_ai:Gemma 4(特别是其面向边缘优化的 E2B 与 E4B 量化版)通过 Locally 等应用,在 iPhone 上实现完全离线运行……
Google 的 Gemma 4 E2B/E4B 量化模型现已通过 Locally AI 等应用,在 iPhone 上实现完全离线运行,借助 Apple Neural Engine 进行本地推理。
Gemma 4 26B A4B 通过模型分页在 iPhone 17 Pro 上运行
谷歌的 Gemma 4 26B A4B 模型可通过模型分页在 iPhone 17 Pro 上运行,实现强大的设备端 AI 功能。
介绍 Gemma 3 270M:超高效 AI 的紧凑型模型
Google 推出 Gemma 3 270M,这是一个拥有 2.7 亿参数的紧凑型模型,专为高效边缘设备 AI 设计,具有强大的指令遵循能力和极致的能效表现(在 Pixel 9 Pro 上进行 25 次对话仅消耗 0.75% 电量)。
@h100envy:谷歌工程师详解如何在手机上用21分钟将小型LLM从46%准确率微调至90% - 比…
一位谷歌工程师分享了在手机上用21分钟将Gemma 270M模型从46%准确率微调至90%的方法,使用合成数据、LoRA、int4量化,离线可达每秒2000 tokens。
谷歌新推出的Gemma 4 12B模型旨在任何配备16GB RAM的笔记本电脑上运行
谷歌发布Gemma 4 12B,这是一款紧凑型AI模型,专为仅需16GB RAM的本地笔记本使用而优化,具备多令牌预测以及针对文本、音频和图像的简化多模态能力。