您现在可以在Apple Silicon Mac上转换EXL3量化模型
摘要
一款新工具支持在Apple Silicon Mac上转换和运行EXL3量化模型,转换质量与RTX相当或几乎持平,让高质量量化更易获取。
大家好,我来更新一下。不过这次是关于本地大语言模型的重大消息。通常,获取像EXL3这样的高保真量化需要CUDA支持,并且需要配备RTX显卡的96GB-128GB显存,这些显卡非常专业且昂贵。但现在,在更通用的平台上,比如搭载Apple Silicon的Mac,你可以轻松找到64GB以上内存的机型——它们虽然不便宜,但普通人也能买到。现在你可以运行、推理甚至转换EXL3模型。我已经在MiniCPM5和Qwen3.6-27B上完成了测试。MiniCPM5的平均KLD与用RTX显卡转换的模型相当,而Qwen3.6-27B仅略微落后。如果你不了解EXL3,这是turboderp及其团队做出的杰出成果。在消费级机器上,它提供了最佳的量化质量与大小比。总体而言,它每个权重的质量比MLX量化高出大约半比特。
https://github.com/beamivalice/PonyExl3 快来获取吧——基于Apache 2.0许可。
祝好,
Beam
相似文章
我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3
将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。
本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据
本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。
~ 2 倍速度提升:针对 Apple Silicon 上的 Qwen3.8 27B
MTPLX 框架在 Apple Silicon 上实现了 Qwen3.8 27B 模型 ~ 2 倍速度提升和 Qwen3.6 35B 模型 ~ 1.5 倍速度提升,具备自动调优和针对 MLX 模型的基准转换功能。
MAX models 现在可以在 Apple silicon GPU 上运行
MAX models 已更新,可在 Apple silicon GPU 上运行,从而在 Mac 上实现更快的推理。
Perplexity 开源其针对 Qwen 3.6 的 Mac 推理服务器
Perplexity 开源了一款针对 Qwen 3.6 模型优化的 Mac 推理服务器,以在 Apple Silicon 上实现最佳性能。