~ 2 倍速度提升:针对 Apple Silicon 上的 Qwen3.8 27B

Reddit r/LocalLLaMA 工具

摘要

MTPLX 框架在 Apple Silicon 上实现了 Qwen3.8 27B 模型 ~ 2 倍速度提升和 Qwen3.6 35B 模型 ~ 1.5 倍速度提升,具备自动调优和针对 MLX 模型的基准转换功能。

https://x.com/koc_z3/status/2093581036756025744?s=46 ~ 2 倍速度提升针对 Apple Silicon 上的 Qwen3.8 27B ~ 1.5 倍速度提升针对 Qwen3.6 35B AЗB 在 M1 Max 64GB Mac 上使用 MTPLX 测试,上下文长度为 262K(最大)。Qwen3.8-27B (Q4): - 解码 ~ 21 TPS - 预填充 ~ 83 TPS(峰值 111 TPS)Qwen3.6-35B-A3B (Q4): - 解码 ~ 55 TPS - 预填充 ~ 300 TPS(峰值 623 TPS)该框架的三个关键功能:经验证,与基础模型相比,本地生成速度提升 ~ 2 倍。自动调优:根据您的特定芯片、散热和内存带宽,确定最佳 MTP 草稿深度。基准转换:将标准基础模型转换为适用于 MLX 的 MTP 模型。代码库:github.com/youssofal/MTPLX
查看原文

相似文章

Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit

Reddit r/LocalLLaMA

用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。