Apple M5 尚未充分利用其矩阵乘法核心
摘要
Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。
目前,MLX(以及适用于 Mac 的 Llama.cpp)在所有地方都使用 16 位激活。尽管如此,M5 代芯片实际上确实支持 INT8 激活——它甚至允许 w4a8 数据类型。只是目前还没有推理后端使用它们。我构建了一些 w8a8 内核,并在 Gemma4 预填充任务上实现了 1.4 倍的加速;在我的 M5 MacBook Air 上,对于 130,173 个输入令牌,E2B 的基准预填充速度从 2193 tps 提升到了 3029 tps。* *在较小的上下文长度下甚至更快;接近近 10k tps。
相似文章
我们为MLX添加了W8A8激活量化——在M5 Pro上预填充从2.84s降至2.52s
Mininglamp AI发布了Cider,一个在Apple的MLX框架上添加W8A8激活量化的小型SDK,通过自定义Metal内核,在M5 Pro上对大型语言模型实现预填充最高1.84倍加速。该工具可与任何MLX模型配合使用,支持M5及以上芯片的INT8 TensorOps。
@ollama:Gemma 4 在 Apple Silicon 上使用 Ollama 和 MLX 提速近 90%!性能提升得益于改进的多 token 预…
Ollama 宣布,Gemma 4 在 Apple Silicon 上使用 MLX 后速度提升近 90%,这得益于默认启用的改进多 token 预测机制,并支持自动调节以避免减速。
@ivanfioravanti: Apple M5 Max + MLX = 原始算力!看看我正在玩的“FasterLivePortrait-MLX”演示,我从 MPS 开始,但结果不……
作者演示了在搭载 M5 Max 芯片的设备上,将 LivePortrait 的实现从 MPS 迁移到 Apple 的 MLX 框架后,性能和速度有了显著提升。
在MLX中使用turboquant(及自定义内核)运行Gemma4 26b MoE
一位开发者成功在Apple MacBook Air M5上使用MLX、turboquant和自定义内核运行了Gemma4 26b MoE,实现了比llama.cpp更快的提示处理和生成速度,且内存占用更低。实现方式包括本地部署说明。
@0x0SojalSec:苹果在每台 M4 Mac 和 iPhone 中隐藏了 15.8 TFLOPS 的原始 AI 算力。他们只允许你使用神经网络引擎进行推理。……
一位开发者逆向工程了苹果的私有 API,使得在 M4 Mac 和 iPhone 的 Apple 神经网络引擎(ANE)上直接训练神经网络成为可能,绕过了 CoreML 和 GPU。该项目表明 ANE 硬件能够进行训练,尽管存在利用率低以及某些操作回退到 CPU 等限制。