您现在可以在Apple Silicon Mac上转换EXL3量化模型

Reddit r/LocalLLaMA 工具

摘要

一款新工具支持在Apple Silicon Mac上转换和运行EXL3量化模型,转换质量与RTX相当或几乎持平,让高质量量化更易获取。

大家好,我来更新一下。不过这次是关于本地大语言模型的重大消息。通常,获取像EXL3这样的高保真量化需要CUDA支持,并且需要配备RTX显卡的96GB-128GB显存,这些显卡非常专业且昂贵。但现在,在更通用的平台上,比如搭载Apple Silicon的Mac,你可以轻松找到64GB以上内存的机型——它们虽然不便宜,但普通人也能买到。现在你可以运行、推理甚至转换EXL3模型。我已经在MiniCPM5和Qwen3.6-27B上完成了测试。MiniCPM5的平均KLD与用RTX显卡转换的模型相当,而Qwen3.6-27B仅略微落后。如果你不了解EXL3,这是turboderp及其团队做出的杰出成果。在消费级机器上,它提供了最佳的量化质量与大小比。总体而言,它每个权重的质量比MLX量化高出大约半比特。 https://github.com/beamivalice/PonyExl3 快来获取吧——基于Apache 2.0许可。 祝好, Beam
查看原文

相似文章