Show HN:开源引擎,可在任何M系列Mac上用2GB内存运行Gemma 4 26B
摘要
TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。
查看缓存全文
缓存时间: 2026/07/29 15:55
TurboFieldfare
在约 2 GB 内存中运行 Gemma 4 26B-A4B 推理
为所有 Apple Silicon Mac(包括 8 GB 机型)打造的自定义 Swift + Metal 运行时
快速开始 · 本地服务器 · 基准测试 · 贡献结果 · 原理说明 · 实验 · 参考
相似文章
@HuggingModels:Gemma 4 来了,它针对 Apple Silicon 进行了优化。这款 4 位量化模型在您的 Mac 上运行快速,而不仅仅是在…
Gemma 4 是一款针对 Apple Silicon 优化的 4 位量化模型,能够在 Mac 设备上实现快速本地推理,减少对云计算的依赖。
在MLX中使用turboquant(及自定义内核)运行Gemma4 26b MoE
一位开发者成功在Apple MacBook Air M5上使用MLX、turboquant和自定义内核运行了Gemma4 26b MoE,实现了比llama.cpp更快的提示处理和生成速度,且内存占用更低。实现方式包括本地部署说明。
在13年历史的Xeon无GPU服务器上以每秒5个token运行Gemma 4 26B
一位开发者成功在无GPU、双路Xeon的13年旧服务器上,使用修改版ik_llama.cpp(无需AVX2指令),以约每秒5个token的速度运行谷歌的Gemma 4 26B混合专家模型。
@Freerunnering: 这实际上使得Gemma 4 26B-4A在我的MacBook Pro M1 Max上以72tk/s的速度可用于编码代理。这个视频是实时的,…
Unsloth AI宣布,Gemma 4在MTP GGUFs上运行速度快了2倍,使得在如MacBook Pro M1 Max这样的硬件上以72 tokens/s的速度运行本地编码代理成为可能。
@mylifcc: 我已经在mac上用上Gemma-4-12b了,技术栈是: llama.cpp + GGUF Q4_K_M + Metal 32K context,本地 OpenAI-compatible API 实测约 36 tok/s,常驻 RSS 约…
用户分享在Mac上使用llama.cpp配合GGUF Q4_K_M量化版Gemma-4-12b模型的经验,实现了约36 tok/s的本地推理速度和约10GB内存占用。