@jundotkim: oMLX 0.5.2 已发布。(很抱歉沉默了这么久!)https://github.com/jundot/omlx/releases… oMLX 是最方便的...

X AI KOLs Timeline 工具

摘要

oMLX 0.5.2 版本新增了实时菜单栏活动、重新组织的模型菜单、Bonsai 低位内核,以及通过自定义 Metal 内核和原生推测解码实现的性能提升,使其成为在 Mac 上运行 MLX 模型的最快方式。

oMLX 0.5.2 已发布。(很抱歉沉默了这么久!) https://github.com/jundot/omlx/releases… oMLX 是在 Mac 上运行 MLX 模型最方便的方式,也是最快的方式,它提供了针对 GLM、MiniMax、DeepSeek V4 和 Qwen 的自定义 Metal 内核。 0.5.2 新功能: - macOS 菜单栏中的实时活动:可选择显示实时、会话和所有时间的吞吐量(PP 和 TG),以及 CPU/GPU/内存使用情况条,每个都有弹出窗口和滚动图表 - 重新组织的模型菜单:直接从菜单栏加载模型,分为已加载、收藏和库,显示加载状态和大小 - 用于极低位模型的 Bonsai 1 位/2 位解码内核 - 更快的 Hugging Face 下载、更多的 TTS 输出格式,以及聊天历史的导入/导出 如果你是从 0.4.x 版本过来的,以下是 0.5 系列新增的功能: - oMLX 自定义内核:预填充性能提升高达:DeepSeek-V4-Flash +45%,Qwen3.6-27B +33%,GLM-5.2 +99%,MiniMax M3 +94%(在我的 M3 Ultra 上) - Lightning MTP:原生推测解码,在自定义内核的 PP 路径上加速 TG。Qwen3.6-35B-A3B 从 89.6 tok/s 提升到 140.4 tok/s,Qwen3.6-27B 从 35.0 tok/s 提升到 55.1 tok/s - oQe imatrix 增强量化:MLX 上最高精度的量化,通过激活重要性校准实现 - 此外,在 0.5.1 和 0.5.2 中针对长时间运行的服务进行了大量稳定性和内存加固 衷心感谢所有贡献、测试、报告错误和分享反馈的人。希望这能让你的 Mac 运行本地模型更加愉快!
查看原文
查看缓存全文

缓存时间: 2026/07/22 16:35

oMLX

LLM 推理,为您的 Mac 优化
连续批处理与分层 KV 缓存,直接从菜单栏管理。

[email protected] · https://omlx.ai/me

安装 · 快速入门 · 功能 · 模型 · CLI 配置 · 基准测试 · oMLX.ai

English · 中文 · 한국어 · 日本語

相似文章

jundot/omlx

GitHub Trending (daily)

oMLX 是一个用于在 Apple Silicon Mac 上进行优化 LLM 推理的新开源工具,具备持续批处理和分层 KV 缓存功能,并通过菜单栏应用进行管理。