Show HN:开源引擎,可在任何M系列Mac上用2GB内存运行Gemma 4 26B

Hacker News Top 工具

摘要

TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。

Hi HN,<p>我构建了一个专门的推理引擎,用于在任意M系列Mac上以约2GB内存运行4位量化的Gemma 4 26B-A4B-IT模型。它名为TurboFieldfare,使用Swift和Metal编写。<p>我一直钟爱设备端AI。能在Mac或iPhone上运行强大的神经网络,感觉就像魔法一样。所以我希望稍微挑战极限,运行一个权重无法完全装入内存的模型。<p>该模型的4位量化权重约占用14GB,一旦加上操作系统、应用程序和KV缓存,在8GB甚至16GB的Mac上使用传统推理工具几乎无法运行。<p>关键在于将模型的共享部分和KV缓存保留在RAM中,然后仅从SSD流式加载每个token所需的路由专家权重。SSD比RAM慢得多,因此运行时使用一个小型专家缓存和有界并行`pread`。在这些读取进行的同时,GPU运行层的共享部分。<p>我进行了100多次实验。大多数没有成功。少数几个让我走到了这里。这些实验在GitHub仓库中有详细描述。<p>目前在8GB M2 MacBook Air上生成速度为5-6 tok/s,在M5 MacBook Pro上为31-35 tok/s。<p>我还添加了一个实验性的兼容OpenAI的本地服务器。它支持流式输出和工具调用,并能复用KV缓存中的一个提示前缀。<p>试试看!Mac应用安装非常简单。首次运行时,它会从Hugging Face下载15GB权重。这个模型的能力出乎意料。<p>非常欢迎任何形式的反馈!
查看原文
查看缓存全文

缓存时间: 2026/07/29 15:55

TurboFieldfare

在约 2 GB 内存中运行 Gemma 4 26B-A4B 推理
为所有 Apple Silicon Mac(包括 8 GB 机型)打造的自定义 Swift + Metal 运行时

快速开始 · 本地服务器 · 基准测试 · 贡献结果 · 原理说明 · 实验 · 参考

相似文章