@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…

X AI KOLs Following 模型

摘要

Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。

设备端小模型的可能性太多了。 @adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。 使用针对 Apple Silicon 优化的 MLX,约 40tk/s 拥有 128K 上下文的移动端 SOTA 编程与数学能力。完全离线,带思考模式。 https://t.co/sPK65qc7Bd
查看原文
查看缓存全文

缓存时间: 2026/05/18 08:29

在设备端运行小模型的可能性太大了。

这里 @adrgrondin 在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。 大约 40tk/s,使用针对 Apple Silicon 优化的 MLX。 在移动端拥有 128K 上下文,具备顶尖的编码和数学能力。完全离线,带思考模式。 https://t.co/sPK65qc7Bd

相似文章

介绍 Gemma 3 270M:超高效 AI 的紧凑型模型

Google DeepMind Blog

Google 推出 Gemma 3 270M,这是一个拥有 2.7 亿参数的紧凑型模型,专为高效边缘设备 AI 设计,具有强大的指令遵循能力和极致的能效表现(在 Pixel 9 Pro 上进行 25 次对话仅消耗 0.75% 电量)。