MLX引擎对比…oMLX是最佳选择。

Reddit r/LocalLLaMA 工具

摘要

一篇博客文章,对比了MLX推理引擎,结论是oMLX是最佳选择,评测在M5 Max 64GB上使用Qwen3.6-35B-A3B-4bit。

刚刚发现这篇博客。如果你正在挑选推理引擎,这是一篇非常有趣的读物。使用M5 Max 64GB,模型为mlx-community/Qwen3.6-35B-A3B-4bit。文章中的MTPLX使用的是3.6 27B,所以并非直接对比。 https://preview.redd.it/huxhasc4gx1h1.png?width=990&format=png&auto=webp&s=88cf7828b18eb8dea7a4c92c041f2b5c795f1824 https://preview.redd.it/fhevre6agx1h1.png?width=990&format=png&auto=webp&s=7bbc9aecbb5684aeeedf712e5a1017d0aab68fa7 [https://www.largitdata.com/blog_detail/20260511](https://www.largitdata.com/blog_detail/20260511)
查看原文

相似文章

jundot/omlx

GitHub Trending (daily)

oMLX 是一个用于在 Apple Silicon Mac 上进行优化 LLM 推理的新开源工具,具备持续批处理和分层 KV 缓存功能,并通过菜单栏应用进行管理。

大语言模型与本地AI硬件的推理引擎(2026版)

X AI KOLs

本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。