标签
Nativ 是一款开源的 macOS 应用,可在 Apple Silicon 上本地运行 Qwen 3.5 9B 及其他开源模型,提供可定制的系统提示词、遥测功能以及与编程代理的集成,无需云服务或订阅。
作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。
一位开发者更新了 MLX-Serve(一个面向 Apple Silicon 的快速本地推理服务器),以支持近期模型,如 LiquidAI 2.6B、MiniMax H3 视频生成和 DeepSeek V4 Flash,AntLing 3.0-flash 即将推出。
Simon Willison 重点介绍了 PipeNetwork/minimax-h3-mlx,这是一个将 MiniMax-H3 移植到 Apple Silicon 上的 MLX 的 Python 包,并演示了在 M5 Max MacBook Pro 上运行它,从文本提示生成视频。
TheTom releases an MLX quantized version of DeepSeek V4 Flash (284B MoE, 21B active) at 3.05 bpw, fitting in 101 GiB to run on 128GB Apple Silicon, with GGUF sibling also available.
Qwen Scribe 是一款开源工具,专为 Apple Silicon Mac 提供隐私、设备本地的转录和听写功能,通过 MLX 使用 Qwen3-ASR 模型。它支持拖放式音视频转码、语言检测、SRT 导出以及带有 HUD 的系统级听写。
Eigen Labs 发起了一项名为 MLX.fast 的开放自动研究竞赛,旨在优化 Laguna XS 2.1 模型在消费级 Mac 上的推理速度,通过社区贡献使其尽可能快。
Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。
Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。
oMLX 0.5.2 版本新增了实时菜单栏活动、重新组织的模型菜单、Bonsai 低位内核,以及通过自定义 Metal 内核和原生推测解码实现的性能提升,使其成为在 Mac 上运行 MLX 模型的最快方式。
一份精选的推荐AI模型列表(例如Qwen3.5、Gemma 4、Mistral Medium),适用于统一内存最高256GB的系统,涵盖创意、编程、智能体及通用聊天等使用场景。
Nativ 是一款免费开源的 macOS 应用,可让您在 Apple Silicon 上本地运行前沿开源 AI 模型,无需账户或订阅。
Nativ是一款免费开源的macOS应用,让用户在Apple Silicon上本地运行前沿开源模型,无需账户、订阅或云端依赖。
作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。
Jun Song 宣布 MLX 新引擎进入最终开发阶段,在 MacBook 上以 256k 上下文窗口达到 41.8 tok/s,仅有约 4% 质量损失,代表着显著的性能提升。
mlx-dspark 将 DeepSeek 的 DSpark 和 z-lab 的 DFlash 推测解码草稿模型通过 MLX 引入 Apple Silicon,实现无损加速(约 1.4–1.6 倍,代码/数学任务可达 2 倍),并提供兼容 OpenAI 的 API 用于本地推理。
MTPLX V2已发布,声称在搭载M5 Max的Macbook Pro上通过MLX运行Qwen 3.6 27B模型时每秒可处理72+ tokens。
mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。