@ivanfioravanti:在 M5 Max 上用 oMLX 本地运行 @karpathy 的 autoresearch,借助 6bit 量化的 gemma-4-26b-a4b-it 训练 Gemma 4 E2B……
摘要
开发者 Ivan Fioravanti 展示如何在 Apple Silicon 上本地运行 Andrej Karpathy 的 autoresearch 项目,使用 6bit 量化 Gemma-4-26B 模型,暗示已成功训练 Gemma 4 E2B IT 变体。
查看缓存全文
缓存时间: 2026/04/22 08:22
用 @karpathy 的 Autoresearch 在本地 M5 Max 上跑 gemma-4-26b-a4b-it-6bit + oMLX,训练 Gemma 4 E2B IT——真能成!
相似文章
@googlegemma: 查看由 @ivanfioravanti 在此发布的原始帖子:
这是一个使用 Apple MLX 在 iPad 上本地运行 Gemma 4 E4B AI 模型的演示,被展示为一个适合儿童的有趣应用。
@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …
MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。
@rohanpaul_ai:Gemma 4(特别是其面向边缘优化的 E2B 与 E4B 量化版)通过 Locally 等应用,在 iPhone 上实现完全离线运行……
Google 的 Gemma 4 E2B/E4B 量化模型现已通过 Locally AI 等应用,在 iPhone 上实现完全离线运行,借助 Apple Neural Engine 进行本地推理。
在MLX中使用turboquant(及自定义内核)运行Gemma4 26b MoE
一位开发者成功在Apple MacBook Air M5上使用MLX、turboquant和自定义内核运行了Gemma4 26b MoE,实现了比llama.cpp更快的提示处理和生成速度,且内存占用更低。实现方式包括本地部署说明。
@analogalok:我刚刚在8GB RTX 4060上完全本地运行了Gemma 4 26B A4B MoE模型,搭配Hermes智能体,现在它正在回测交易策略……
一位开发者展示了在8GB RTX 4060上本地运行Gemma 4 26B MoE模型,结合Hermes智能体,完全自动化回测交易策略,凸显了本地LLM作为自主智能体的日益增强的能力。