~ 2 倍速度提升:针对 Apple Silicon 上的 Qwen3.8 27B
摘要
MTPLX 框架在 Apple Silicon 上实现了 Qwen3.8 27B 模型 ~ 2 倍速度提升和 Qwen3.6 35B 模型 ~ 1.5 倍速度提升,具备自动调优和针对 MLX 模型的基准转换功能。
https://x.com/koc_z3/status/2093581036756025744?s=46 ~ 2 倍速度提升针对 Apple Silicon 上的 Qwen3.8 27B ~ 1.5 倍速度提升针对 Qwen3.6 35B AЗB 在 M1 Max 64GB Mac 上使用 MTPLX 测试,上下文长度为 262K(最大)。Qwen3.8-27B (Q4): - 解码 ~ 21 TPS - 预填充 ~ 83 TPS(峰值 111 TPS)Qwen3.6-35B-A3B (Q4): - 解码 ~ 55 TPS - 预填充 ~ 300 TPS(峰值 623 TPS)该框架的三个关键功能:经验证,与基础模型相比,本地生成速度提升 ~ 2 倍。自动调优:根据您的特定芯片、散热和内存带宽,确定最佳 MTP 草稿深度。基准转换:将标准基础模型转换为适用于 MLX 的 MTP 模型。代码库:github.com/youssofal/MTPLX
相似文章
Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍
mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。
@nash_su: Mac 推理速度翻倍 这个 MTPLX 是 MLX + MTP 的整合解决方案,专门针对 Apple Silicon 进行了模型推理优化,使用加入了定制 MTP head 的模型,可以提供翻倍的推理速度。 我测试过了,Qwen3.6-27…
MTPLX 是 MLX 与 MTP 的整合解决方案,专门针对 Apple Silicon 优化模型推理速度,测试显示 Qwen3.6-27B 推理速度比 LM Studio 翻倍,并集成了风扇管理。
Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit
用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。
@Youssofal_: 在搭载M5 Max的Macbook Pro上,Qwen 3.6 27B模型达到72+ TPS。MTPLX V2现已发布!在MLX上运行模型的最快方式。
MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。
Qwen3.8-27B-Uncensored-MLX (阅读时长4分钟)
这是一个针对 Apple Silicon 量化的 Qwen Qwen3.8-27B 模型的无审查 MLX 构建,移除了安全对齐用于研究目的。