Mac发烧友:2026年9月MLX还有存在价值吗?

Reddit r/LocalLLaMA 新闻

摘要

一名用户质疑MLX在Apple M5芯片上的相关性,因为llama.cpp的Metal更新提升了GGUF模型的预填充性能,使得MLX在某些任务上可能变得冗余。

这可能有些特定于Qwen3.8 27b和Apple M5系列,但足够多的人在运行这个组合,所以值得提出来。GGUF模型与MTP结合一直是一段时间以来令牌生成最快的方式,除了可能一些在alpha阶段MLX分叉上运行的调整过的MTPLX模型。然而,在MLX下,预填充在M5上仍然快得多。这导致我根据预期的生成/预填充混合来切换模型,这很烦人。在我没注意的时候,llama.cpp for Metal似乎添加了对M5矩阵乘法/“神经加速器”的支持,因为例如Unsloth的Q_8 GGUF的预填充性能现在至少与我见过的任何MLX模型一样好(约300-350t/s)——甚至在oMLX中。这是一个令人愉快的惊喜!现在我想不到使用MLX模型的任何理由。我是不是错过了什么?我的观察是否错误?在M5 Pro上使用Qwen3.8 27b的Q8/8位范围,我能比约19t/s生成和300t/s+预填充做得更好吗?有没有秘密方法让主流MLX MTP工作?还是这只是因为特定模型的问题?
查看原文

相似文章

Apple M5 尚未充分利用其矩阵乘法核心

Reddit r/LocalLLaMA

Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。