标签
一位用户改造了一台 HomePod Mini,通过 Spark 集群和 oMLX 将其连接到本地 AI 模型 GLM 5.3 Flash,以实现流畅的 AI 对话,并提到大型 AI 公司不会支持这个项目。
在MacBook Pro M5 Max上的基准测试显示,禁用Qwen3.8-27B的思考模式会严重降低输出质量,而xhigh思考模式则使用5.5倍更多的令牌并运行6倍更长时间。
作者使用Codex优化了oMLX上的DeepSeek V4 Flash 8-bit MLX,实现了约1.6倍的预填充速度和3倍的解码加速。
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
一篇博客文章,对比了MLX推理引擎,结论是oMLX是最佳选择,评测在M5 Max 64GB上使用Qwen3.6-35B-A3B-4bit。