MTPLX V1:用于运行和创建MLX MTP模型的Swift应用(2倍TPS的Qwen 3.6 27B)

Reddit r/LocalLLaMA 工具

摘要

MTPLX V1是一款原生Mac应用,集成了用于MLX模型的MTP投机解码引擎,提供通过Forge进行模型转换、内置聊天、基准测试以及支持较小模型等功能。它实现了超过2倍的加速,且数学上精确无误。

大家好!大约一个月前,我通过MTPLX V0.1将原生MTP引入了MLX。该CLI将Qwen 3.6 27B从28tps提升到63tps,但功能相当简陋。因此,在从本社区收到大量宝贵反馈后,我对其进行了重构。**MTPLX V1现在是一款原生Mac应用**(基于Swift),它集成了整个引擎,并完全在设备上运行您的模型。一个DMG文件,约55MB,包含所有内容。CLI也同样保留。 https://reddit.com/link/1u3iikl/video/4q72098mgr6h1/player 实际新增了什么?**Forge:**这是我最兴奋的功能。在v0.1帖子中,最大的抱怨是几乎没有MLX量化模型附带其MTP头部,因此除了我自己的模型外,基本上没有其他模型可以运行。Forge解决了这个问题:粘贴Hugging Face链接,它会将模型转换为MLX并连接好MTP头部,然后在你提交前测量你机器上的*实际*加速效果。 **一键服务:** 简单内置了OpenCode、Hermes和Pi支持,同时也支持任何开放API或Anropic API端点。 **内置聊天 + 实时仪表盘:** 原生高性能流式聊天,加上一个仪表盘,实时显示解码速度表、按深度的接受率以及验证瀑布图,让你真正看到投机循环在做什么。 内置基准测试:为了好玩,应用中内置了AIME 2026来检查模型的准确性。一键运行。 **更小的Mac:** 说实话,V0.1有点炫耀M5 Max。v1增加了Qwen 3.5 9B和Gemma 4(以及Qwen 3.6 MoE),这样使用较旧或较小机器的用户也能参与进来。 引擎升级:RAM+SSD KV缓存,使得会话在重启后仍然保留并近乎即时恢复,KV缓存量化,智能风扇模式(仅在有请求时加速),连续批处理(仅自回归模式),错误修复。 核心不变,它**在任何温度下都是数学精确的**。采用Leviathan–Chen拒绝采样并带有残差校正,在真实温度下与普通自回归的logits差异验证为0.0。与没有MTP时得到的输出相同,只是速度提高了2倍以上。不像其他Apple Silicon投机解码项目那样只能贪心解码。依旧开源,依旧是单人开发。仅支持Apple Silicon(macOS 14+)。 网站:[https://mtplx.com](https://mtplx.com) GitHub:[https://github.com/youssofal/MTPLX](https://github.com/youssofal/MTPLX) 欢迎反馈、错误报告和PR。如果你发布MLX量化模型,请保留MTP头部(或者直接通过Forge运行仓库)。MTP头部模型越多,对大家就越好。再次感谢所有在v0.1上推动我的人!
查看原文

相似文章