Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍

Reddit r/LocalLLaMA 工具

摘要

mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。

mlx-dspark 是 DeepSeek 的 DSpark 推测解码草稿生成器(DeepSpec 发布版)的 MLX 移植版,加上 z-lab 的 DFlash,具备一个无损验证循环。v0.10.0 通过 RadixArk 的草稿生成器新增了对 Qwen3.8-27B 的支持,这是它加载的首个 SpecForge/SGLang 打包的模型。性能数据(M4 Pro 48 GB,三次测试中位数,贪婪解码,输出ID与普通解码相同):8位目标:在自动选择上限下平均2.45倍 — 数学3.00倍 / 代码2.38倍 / 对话1.96倍,从8.3提升到20.3 tok/s(代码运行可达3.18倍)。峰值约29 GB。4位目标:1.74倍,速度25.3 tok/s,内存约18 GB(同一草稿生成器自动适配)。有趣特性:8位 + 草稿生成器(20-27 tok/s)优于普通4位(14.6 tok/s)— 以优于4位的速度提供8位质量。"无损"是经验证的,而非断言:目标会验证每个草稿生成的令牌,Mac应用的Race视图在相同提示下运行推测解码与普通解码并对比令牌ID(视频展示了该视图)。所有功能可通过pip install mlx-dspark安装(兼容OpenAI的服务器 + Anthropic Messages API,因此可用本地模型支持Claude Code),并有原生Mac应用(DMG/Homebrew)。仓库:github.com/ARahim3/mlx-dspark 欢迎使用后提供任何反馈。
查看原文

相似文章

Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit

Reddit r/LocalLLaMA

用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。