MTPLX V1:用于运行和创建MLX MTP模型的Swift应用(2倍TPS的Qwen 3.6 27B)
摘要
MTPLX V1是一款原生Mac应用,集成了用于MLX模型的MTP投机解码引擎,提供通过Forge进行模型转换、内置聊天、基准测试以及支持较小模型等功能。它实现了超过2倍的加速,且数学上精确无误。
大家好!大约一个月前,我通过MTPLX V0.1将原生MTP引入了MLX。该CLI将Qwen 3.6 27B从28tps提升到63tps,但功能相当简陋。因此,在从本社区收到大量宝贵反馈后,我对其进行了重构。**MTPLX V1现在是一款原生Mac应用**(基于Swift),它集成了整个引擎,并完全在设备上运行您的模型。一个DMG文件,约55MB,包含所有内容。CLI也同样保留。
https://reddit.com/link/1u3iikl/video/4q72098mgr6h1/player
实际新增了什么?**Forge:**这是我最兴奋的功能。在v0.1帖子中,最大的抱怨是几乎没有MLX量化模型附带其MTP头部,因此除了我自己的模型外,基本上没有其他模型可以运行。Forge解决了这个问题:粘贴Hugging Face链接,它会将模型转换为MLX并连接好MTP头部,然后在你提交前测量你机器上的*实际*加速效果。
**一键服务:** 简单内置了OpenCode、Hermes和Pi支持,同时也支持任何开放API或Anropic API端点。
**内置聊天 + 实时仪表盘:** 原生高性能流式聊天,加上一个仪表盘,实时显示解码速度表、按深度的接受率以及验证瀑布图,让你真正看到投机循环在做什么。
内置基准测试:为了好玩,应用中内置了AIME 2026来检查模型的准确性。一键运行。
**更小的Mac:** 说实话,V0.1有点炫耀M5 Max。v1增加了Qwen 3.5 9B和Gemma 4(以及Qwen 3.6 MoE),这样使用较旧或较小机器的用户也能参与进来。
引擎升级:RAM+SSD KV缓存,使得会话在重启后仍然保留并近乎即时恢复,KV缓存量化,智能风扇模式(仅在有请求时加速),连续批处理(仅自回归模式),错误修复。
核心不变,它**在任何温度下都是数学精确的**。采用Leviathan–Chen拒绝采样并带有残差校正,在真实温度下与普通自回归的logits差异验证为0.0。与没有MTP时得到的输出相同,只是速度提高了2倍以上。不像其他Apple Silicon投机解码项目那样只能贪心解码。依旧开源,依旧是单人开发。仅支持Apple Silicon(macOS 14+)。
网站:[https://mtplx.com](https://mtplx.com)
GitHub:[https://github.com/youssofal/MTPLX](https://github.com/youssofal/MTPLX)
欢迎反馈、错误报告和PR。如果你发布MLX量化模型,请保留MTP头部(或者直接通过Forge运行仓库)。MTP头部模型越多,对大家就越好。再次感谢所有在v0.1上推动我的人!
相似文章
@nash_su: Mac 推理速度翻倍 这个 MTPLX 是 MLX + MTP 的整合解决方案,专门针对 Apple Silicon 进行了模型推理优化,使用加入了定制 MTP head 的模型,可以提供翻倍的推理速度。 我测试过了,Qwen3.6-27…
MTPLX 是 MLX 与 MTP 的整合解决方案,专门针对 Apple Silicon 优化模型推理速度,测试显示 Qwen3.6-27B 推理速度比 LM Studio 翻倍,并集成了风扇管理。
@Youssofal_:MTPLX V0.3 已发布!- 我意识到 M1 和 M2 Mac 并不支持 BF16,之前只是在模拟该格式,导致每秒生成的 tokens 数(TPS)显著下降……
MTPLX v0.3 已发布,这是一个专为 Apple Silicon 设计的原生运行时。它采用多 token 预测(MTP)技术将解码速度提高一倍,并通过 Leviathan-Chen 接受机制维持分布准确性。
@Youssofal_: 在搭载M5 Max的Macbook Pro上,Qwen 3.6 27B模型达到72+ TPS。MTPLX V2现已发布!在MLX上运行模型的最快方式。
MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。
@Youssofal_: 感谢 Kate 对 MTPLX 的全面评测。她测试了多种不同的 MLX 运行时,并得出结论 MTP…
nicekate 在 Mac 上测试了多种 MLX 运行时以运行 Qwen3.6-27B,并得出结论 MTPLX 是最快的,在 4bit 量化下达到 43 tok/s。
@AlexJonesax: 如果你在 Mac 上运行 LLM,值得了解的两个开源 MLX 推理服务器:MTPLX (@youssofal) 利用模型自身的…
本文介绍了两个适用于 Mac 的开源 MLX 推理服务器:MTPLX 通过投机解码(无需草稿模型)优化 token 生成速度,而 oMLX 则通过持久化的 KV 缓存提升代码智能体的工作流效率。