Mac发烧友:2026年9月MLX还有存在价值吗?
摘要
一名用户质疑MLX在Apple M5芯片上的相关性,因为llama.cpp的Metal更新提升了GGUF模型的预填充性能,使得MLX在某些任务上可能变得冗余。
这可能有些特定于Qwen3.8 27b和Apple M5系列,但足够多的人在运行这个组合,所以值得提出来。GGUF模型与MTP结合一直是一段时间以来令牌生成最快的方式,除了可能一些在alpha阶段MLX分叉上运行的调整过的MTPLX模型。然而,在MLX下,预填充在M5上仍然快得多。这导致我根据预期的生成/预填充混合来切换模型,这很烦人。在我没注意的时候,llama.cpp for Metal似乎添加了对M5矩阵乘法/“神经加速器”的支持,因为例如Unsloth的Q_8 GGUF的预填充性能现在至少与我见过的任何MLX模型一样好(约300-350t/s)——甚至在oMLX中。这是一个令人愉快的惊喜!现在我想不到使用MLX模型的任何理由。我是不是错过了什么?我的观察是否错误?在M5 Pro上使用Qwen3.8 27b的Q8/8位范围,我能比约19t/s生成和300t/s+预填充做得更好吗?有没有秘密方法让主流MLX MTP工作?还是这只是因为特定模型的问题?
相似文章
Apple M5 尚未充分利用其矩阵乘法核心
Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。
@jun_song: MLX 的新引擎正处于开发的最后阶段。刚刚在一台 MacBook(116GB)上运行 GLM-5.2,达到 41.8…
Jun Song 宣布 MLX 新引擎进入最终开发阶段,在 MacBook 上以 256k 上下文窗口达到 41.8 tok/s,仅有约 4% 质量损失,代表着显著的性能提升。
@TheAhmadOsman: 需要明确的是,如果您比较GPU和新的M5 Ultra Mac Studio,CUDA仍然比MLX更成熟。然而,生态系统…
讨论比较了CUDA与MLX在Apple的M5 Ultra Mac Studio背景下的成熟度,强调需要竞争来优化本地AI硬件,这可能使Apple超越NVIDIA。
@ivanfioravanti: Apple M5 Max + MLX = 原始算力!看看我正在玩的“FasterLivePortrait-MLX”演示,我从 MPS 开始,但结果不……
作者演示了在搭载 M5 Max 芯片的设备上,将 LivePortrait 的实现从 MPS 迁移到 Apple 的 MLX 框架后,性能和速度有了显著提升。
我在Apple Silicon上使用MLX和OpenClaw集成了新的δ-mem研究!我的发现
作者使用MLX和OpenClaw在Apple Silicon上实现了δ-mem研究论文,展示了在本地AI代理测试中的内存和注意力改进,尽管与CUDA基准相比结果好坏参半。