@AlexJonesax:在M5Max上启用MTP和oMLX推理,Qwen3.6-27b飞速运行
摘要
社区报告称,通过oMLX优化,Qwen3.6-27b模型在M5Max硬件上实现了极高的推理性能。
启用MTP和oMLX推理后,Qwen3.6-27b在M5Max上极速运行。https://t.co/pc52oqga78
查看缓存全文
缓存时间: 2026/05/11 12:43
开启 MTP 并搭配 oMLX 推理,Qwen3.6-27b 在 M5Max 上跑得飞快。https://t.co/pc52oqga78
相似文章
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
MLX引擎对比…oMLX是最佳选择。
一篇博客文章,对比了MLX推理引擎,结论是oMLX是最佳选择,评测在M5 Max 64GB上使用Qwen3.6-35B-A3B-4bit。
@Youssofal_: 在搭载M5 Max的Macbook Pro上,Qwen 3.6 27B模型达到72+ TPS。MTPLX V2现已发布!在MLX上运行模型的最快方式。
MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。
在Strix Halo上运行的Qwen3.8-27B Q8_0令人印象深刻
作者在配备Ryzen AI Max+ 395的ROG Flow Z13上测试了Qwen3.8-27B Q8_0 AI模型,使用Lemonade Server和llama.cpp进行推测解码,实现了令人印象深刻的本地推理性能,生成了一个飞行模拟器。
我在exo中为Qwen3.6 MLX模型添加了原生MTP支持;以下是精确度和速度结果
为exo本地推理工具添加了对Qwen3.6 MLX模型的原生多token预测(MTP)支持,在M5 Max笔记本上对27B模型实现了高达2倍的加速,同时保持精确度。