@Youssofal_: 感谢 Kate 对 MTPLX 的全面评测。她测试了多种不同的 MLX 运行时,并得出结论 MTP…
摘要
nicekate 在 Mac 上测试了多种 MLX 运行时以运行 Qwen3.6-27B,并得出结论 MTPLX 是最快的,在 4bit 量化下达到 43 tok/s。
查看缓存全文
缓存时间: 2026/05/16 19:21
感谢 Kate 对 MTPLX 的详尽评测。
她测试了多个不同的 MLX 运行时,得出结论:MTPLX 是最快的!
最大的发现是,我不小心从模型中剥离了视觉头部,很快就会把它恢复。
我期待周末为 MTPLX 带来重大升级。
nicekate (@nicekate8888):
最近二十天我都在折腾一件事——怎么让 Qwen3.6-27B 在我的 Mac 上跑得又快又好。一开始我用 Unsloth Q5,18 tok/s,风扇呼啦呼啦响。
后来换成 MLX 6bit + DFlash,提到 22 tok/s,还是不够快。
直到我遇到了 MTPLX 4bit,43 tok/s,质量不错。
完整视频:🧵
相似文章
@Youssofal_: 在搭载M5 Max的Macbook Pro上,Qwen 3.6 27B模型达到72+ TPS。MTPLX V2现已发布!在MLX上运行模型的最快方式。
MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。
MTPLX V1:用于运行和创建MLX MTP模型的Swift应用(2倍TPS的Qwen 3.6 27B)
MTPLX V1是一款原生Mac应用,集成了用于MLX模型的MTP投机解码引擎,提供通过Forge进行模型转换、内置聊天、基准测试以及支持较小模型等功能。它实现了超过2倍的加速,且数学上精确无误。
@Youssofal_:MTPLX V0.3 已发布!- 我意识到 M1 和 M2 Mac 并不支持 BF16,之前只是在模拟该格式,导致每秒生成的 tokens 数(TPS)显著下降……
MTPLX v0.3 已发布,这是一个专为 Apple Silicon 设计的原生运行时。它采用多 token 预测(MTP)技术将解码速度提高一倍,并通过 Leviathan-Chen 接受机制维持分布准确性。
@nash_su: Mac 推理速度翻倍 这个 MTPLX 是 MLX + MTP 的整合解决方案,专门针对 Apple Silicon 进行了模型推理优化,使用加入了定制 MTP head 的模型,可以提供翻倍的推理速度。 我测试过了,Qwen3.6-27…
MTPLX 是 MLX 与 MTP 的整合解决方案,专门针对 Apple Silicon 优化模型推理速度,测试显示 Qwen3.6-27B 推理速度比 LM Studio 翻倍,并集成了风扇管理。
@nicekate8888: 最近二十天我都在折腾一件事——怎么让 Qwen3.6-27B 在我的 Mac 上跑得又快又好。 一开始我用 Unsloth Q5,18 tok/s,风扇呼啦呼啦响。 后来换成 MLX 6bit + DFlash,提到 22 tok/s,还…
用户分享在Mac上通过不同量化方法(Unsloth Q5、MLX 6bit + DFlash、MTPLX 4bit)优化Qwen3.6-27B推理速度的经验,最终达到43 tok/s。