Meta的Muse Glimmer 30B现在在Mac上通过mlx-dspark运行速度提升约3.3倍

Reddit r/LocalLLaMA 工具

摘要

一位开发者报告称,通过mlx-dspark中的推测解码,Meta的Muse Glimmer 30B在Apple Silicon上运行速度提升约3.3倍,输出与逐字节完全相同,且没有质量损失。

我在Apple Silicon上折腾推测解码已经有一段时间了,本周我让Meta的新Muse Glimmer 30B在我的项目mlx-dspark中跑了起来。在我的M4 Pro上,8位模型根据内容不同,从8.2 tok/s提升到18-26 tok/s。数学题是最佳情况,达到3.27倍,代码为2.5倍,聊天为2.22倍。由于目标模型会验证每一个token,输出与普通解码逐字节相同,因此没有质量损失;只是速度更快了。Meta自己在Mac上的DFlash数据是1.5倍(M4 Max)/ 1.8倍(M5 Max),但那是基于4位版本,所以并不完全是同类比较。对我而言,4位版本大约1.7倍,约25 tok/s,且只需约18GB内存。8位运行峰值约40GB,所以你需要一台48GB的Mac。基本上,你获得了8位的质量,却拥有4位的速度。仓库:github.com/ARahim3/mlx-dspark 欢迎反馈,我也很好奇其他M系列芯片的表现。
查看原文

相似文章

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。