Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍
摘要
mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。
mlx-dspark 是 DeepSeek 的 DSpark 推测解码草稿生成器(DeepSpec 发布版)的 MLX 移植版,加上 z-lab 的 DFlash,具备一个无损验证循环。v0.10.0 通过 RadixArk 的草稿生成器新增了对 Qwen3.8-27B 的支持,这是它加载的首个 SpecForge/SGLang 打包的模型。性能数据(M4 Pro 48 GB,三次测试中位数,贪婪解码,输出ID与普通解码相同):8位目标:在自动选择上限下平均2.45倍 — 数学3.00倍 / 代码2.38倍 / 对话1.96倍,从8.3提升到20.3 tok/s(代码运行可达3.18倍)。峰值约29 GB。4位目标:1.74倍,速度25.3 tok/s,内存约18 GB(同一草稿生成器自动适配)。有趣特性:8位 + 草稿生成器(20-27 tok/s)优于普通4位(14.6 tok/s)— 以优于4位的速度提供8位质量。"无损"是经验证的,而非断言:目标会验证每个草稿生成的令牌,Mac应用的Race视图在相同提示下运行推测解码与普通解码并对比令牌ID(视频展示了该视图)。所有功能可通过pip install mlx-dspark安装(兼容OpenAI的服务器 + Anthropic Messages API,因此可用本地模型支持Claude Code),并有原生Mac应用(DMG/Homebrew)。仓库:github.com/ARahim3/mlx-dspark 欢迎使用后提供任何反馈。
相似文章
Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit
用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。
Meta的Muse Glimmer 30B现在在Mac上通过mlx-dspark运行速度提升约3.3倍
一位开发者报告称,通过mlx-dspark中的推测解码,Meta的Muse Glimmer 30B在Apple Silicon上运行速度提升约3.3倍,输出与逐字节完全相同,且没有质量损失。
@_ARahim_: DeepSeek 的 DSpark 推测解码草稿模型,在 Mac(原生 Apple Silicon,MLX)上基准测试,无损;结果与基础模型完全一致……
mlx-dspark 将 DeepSeek 的 DSpark 和 z-lab 的 DFlash 推测解码草稿模型通过 MLX 引入 Apple Silicon,实现无损加速(约 1.4–1.6 倍,代码/数学任务可达 2 倍),并提供兼容 OpenAI 的 API 用于本地推理。
Qwen3.6-27B 推测解码在更大量化下性能提升
Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。
@neural_avb:我正在将SAM模型及其工具套件移植到Apple silicon上。已经在mlx上看到1.25倍推理速度提升……
将SAM 2.1模型移植到Apple silicon上(使用MLX),在小模型上实现了1.25倍推理速度提升,计划推出量化版。