Perplexity 开源其针对 Qwen 3.6 的 Mac 推理服务器
摘要
Perplexity 开源了一款针对 Qwen 3.6 模型优化的 Mac 推理服务器,以在 Apple Silicon 上实现最佳性能。
https://preview.redd.it/6h4xc5o8l6nh1.png?width=1158&format=png&auto=webp&s=b65074b6baaa1faa2347e5259229c8ba803bcd4b 以下是仓库链接:https://github.com/perplexityai/pplx-garden/tree/main/lily 它针对单一模型进行了优化,以在 Apple Silicon 上获得最佳性能。
相似文章
@LinusEkenstam: 相当重要的进展。比MLX-LM推理速度快1.35倍,在预填充阶段速度快1.23倍,能够从内部选择混合选项。
Perplexity已经开源了Lily,这是一个针对Apple Silicon优化的本地推理引擎,专门用于Qwen3.6-35B-A3B模型,实现了比MLX-LM快1.35倍的推理速度。
Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍
mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。
本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据
本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。
@LinusEkenstam:Perplexity中的本地模型 就在下周Apple活动前夕,Perplexity再次展示了前进的道路 f…
Perplexity为其Mac应用引入混合计算,使本地模型能够对敏感数据进行推理,同时将部分计算卸载到云端,这标志着透明本地AI使用的趋势。
在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。