在 500MB 内存上运行 Gemma 4
摘要
讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。
https://x.com/i/status/2084656348617392261 https://www.reddit.com/r/LLMDevs/s/9oL5ogmE6s
相似文章
@_philschmid: 更多 Gemma 4!新的 QAT Gemma 4 检查点,性能相似,内存使用减少约 4 倍!它附带了一种新的移动…
新的 QAT Gemma 4 检查点提供相似的性能,内存使用减少约 4 倍,通过一种新的移动端量化格式,使 Gemma 4 E2B 的内存占用仅需 1GB。
@amitiitbhu: Gemma 4 现在使用 MTP GGUFs 速度提升2倍!仅需6GB内存即可本地运行。新文章:GGUF如何工作?阅读:htt…
Gemma 4 现在使用 MTP GGUF 格式速度快2倍,且仅需6GB内存即可本地运行。相关文章解释了GGUF的工作原理,包括量化和内存映射。
Gemma 4 QAT模型:为移动和笔记本电脑效率优化压缩
谷歌发布采用量化感知训练(QAT)优化的Gemma 4模型,旨在提升移动和笔记本电脑部署的效率,将E2B模型的内存占用降至1GB,同时保持质量。
Gemma 4 + LiteRT-LM在移动设备上:内存和性能远优于我的llama.cpp设置
用户分享在移动设备上运行Gemma 4与LiteRT-LM的亲身对比体验,相较于之前的llama.cpp设置,内存占用显著降低(1.5-2 GB vs 4-5 GB),推理速度更快(2-4秒 vs 7-10秒),测试机型包括三星S25 Ultra和iPhone 13 Pro Max。
Gemma 4 视觉
Gemma 4 的视觉表现受默认 token 预算过低拖累;在 llama.cpp 中将 --image-max-tokens 提到 2240,可解锁顶尖 OCR 与细节识别,代价是额外占用约 14 GB 显存。