@LinusEkenstam: 相当重要的进展。比MLX-LM推理速度快1.35倍,在预填充阶段速度快1.23倍,能够从内部选择混合选项。
摘要
Perplexity已经开源了Lily,这是一个针对Apple Silicon优化的本地推理引擎,专门用于Qwen3.6-35B-A3B模型,实现了比MLX-LM快1.35倍的推理速度。
查看缓存全文
缓存时间: 2026/09/03 12:09
相当重要的进展:
相比MLX-LM,推理速度提升1.35倍 预填充速度提升1.23倍
能在Perplexity内直接选择混合计算模式实在太棒了,而Lily的开源更是锦上添花。
任何人都能利用这项技术,操作系统可以在此基础上实现更大的突破。
Perplexity (@perplexity_ai): 今天我们开源了Lily——这是为Perplexity Computer中的混合计算构建的本地推理引擎。
Lily专为苹果芯片上的Qwen3.6-35B-A3B模型优化,确保设备端计算不会成为Computer任务的性能瓶颈。
了解更多:
相似文章
优化Apple Silicon设备端推理(20分钟阅读)
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。
Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍
mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。
Perplexity 开源其针对 Qwen 3.6 的 Mac 推理服务器
Perplexity 开源了一款针对 Qwen 3.6 模型优化的 Mac 推理服务器,以在 Apple Silicon 上实现最佳性能。
~ 2 倍速度提升:针对 Apple Silicon 上的 Qwen3.8 27B
MTPLX 框架在 Apple Silicon 上实现了 Qwen3.8 27B 模型 ~ 2 倍速度提升和 Qwen3.6 35B 模型 ~ 1.5 倍速度提升,具备自动调优和针对 MLX 模型的基准转换功能。
@LinusEkenstam:Perplexity中的本地模型 就在下周Apple活动前夕,Perplexity再次展示了前进的道路 f…
Perplexity为其Mac应用引入混合计算,使本地模型能够对敏感数据进行推理,同时将部分计算卸载到云端,这标志着透明本地AI使用的趋势。