Apple M5 尚未充分利用其矩阵乘法核心

Reddit r/LocalLLaMA 新闻

摘要

Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。

目前,MLX(以及适用于 Mac 的 Llama.cpp)在所有地方都使用 16 位激活。尽管如此,M5 代芯片实际上确实支持 INT8 激活——它甚至允许 w4a8 数据类型。只是目前还没有推理后端使用它们。我构建了一些 w8a8 内核,并在 Gemma4 预填充任务上实现了 1.4 倍的加速;在我的 M5 MacBook Air 上,对于 130,173 个输入令牌,E2B 的基准预填充速度从 2193 tps 提升到了 3029 tps。* *在较小的上下文长度下甚至更快;接近近 10k tps。
查看原文

相似文章