@Raullen:Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型可靠到足以运行你的代理工作流程,而不仅仅是演示…

X AI KOLs Following 工具

摘要

Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。

Rapid-MLX 0.11.0 发布了!让 Apple Silicon 上的本地模型足够可靠,能够运行你的代理工作流程,而不仅仅是演示它们。 性能 • 前缀缓存复用:13.1 秒 → 0.51 秒 TTFT(在重复的 6k token 前缀上快 25.6 倍)。共享系统提示不再需要两次预填充。一个会话节省了 38,032 个 token。 • 响应缓存:656 毫秒 → 2 毫秒(快 284 倍,字节一致,无需 GPU 解码)。 • 吞吐量:Qwen3.5-4B-4bit 上每秒 152 个 token。冷启动只需几秒。 "rapid-mlx chat" 已成长为一个真正的代理 指向任意 MCP 服务器,它就能自主链式调用工具(例如:文件系统服务器 → 14 个工具 → list_directory → 答案),并配有实时工具活动界面。思考预算会在解码时强制关闭 <think> 标签,以保持响应迅速。 5 个新模型家族 • HY3 295B MoE(原生 MTP 投机解码),Qwen3-Coder-Next 80B,MiniCPM5,LFM2.x,以及一个实际可运行的 2 位三元 Bonsai。 • Kokoro TTS → Parakeet STT 往返验证,单词完美。 • Qwen3-VL 视觉,KV 缓存导出/导入,以及基于 llguidance 的结构化输出。 通过构造实现模式有效的工具调用。 如果你在本地模型上运行编码代理,你就会知道“几乎 JSON”的参数破坏解析器的痛苦。0.11.0 限制了解码本身——模型无法发出格式错误的工具调用。 • 在 harmony/gpt-oss、qwen3_coder_xml、gemma4、deepseek_v3 以及 hermes 上验证。 • 自动、强制和必需。默认开启,无需任何标志。 • 关键点:现在也适用于推理模型!<think> 标签不再因语法偏移问题而破坏强制调用。 可靠性与坦诚的差距 每个版本都会运行自动化的自用测试(5 个模型 × 11 项检查在真实硬件上)。无效模式 → 诚实的 400 错误。未知模型 → 404 并列出可用选项。没有静默回退。差距:Qwen3.6 原生 MTP 暂时搁置,同一台机器上的 Ollama 对比测试即将进行。 现已加入 homebrew-core brew install rapid-mlx rapid-mlx chat qwen3.5-4b-4bit Apache-2.0 许可,MLX 原生。3.4k Star——搞坏它然后告诉我们,问题会快速得到回复。
查看原文
查看缓存全文

缓存时间: 2026/07/25 20:11

Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型足够可靠,能运行你的智能体工作流,而不仅仅是演示。

性能 • 前缀缓存复用:首令牌生成时间从 13.1 秒降至 0.51 秒(对重复的 6k 令牌前缀提速 25.6 倍)。共享系统提示词无需重复预填充。单个会话节省了 38,032 个令牌。 • 响应缓存:从 656 毫秒降至 2 毫秒(加速 284 倍,字节完全相同,零 GPU 解码)。 • 吞吐量:Qwen3.5-4B-4bit 模型达到 152 tok/s。冷启动只需数秒。

“rapid-mlx chat” 已进化为真正的智能体。将其指向任何 MCP 服务器,它就能自主编排工具(例如,文件系统服务器 → 14 个工具 → list_directory → 给出答案),并配有实时工具活动界面。思考预算会在解码阶段强制结束,以保持响应迅捷。

5 个新模型系列 • HY3 295B MoE(原生 MTP 推测解码)、Qwen3-Coder-Next 80B、MiniCPM5、LFM2.x,以及一个实际可运行的 2 比特三元 Bonsai 模型。 • Kokoro TTS → Parakeet STT 闭环验证,字词准确无误。 • Qwen3-VL 视觉能力、KV 缓存导入/导出,以及基于 llguidance 的结构化输出。通过设计保证工具调用的模式合规。

如果你在本地模型上运行编码智能体,一定深知“几乎 JSON”的参数会把解析器搞崩。0.11.0 直接约束解码过程——模型无法输出格式错误的工具调用。 • 在 harmony/gpt-oss、qwen3_coder_xml、gemma4、deepseek_v3 以及 hermes 上已验证。 • 自动、强制与必需三种模式。默认开启,零额外标记。 • 关键点:现在对推理模型也生效!由于语法偏移问题,<工具调用> 标签不再破坏强制调用。

可靠性与坦诚不足之处 每次发布都会运行自动化的内部测试(5 个模型 × 11 项检查,在真实硬件上运行)。无效模式 → 返回 400。未知模型 → 返回 404 并提供可用选项。没有静默降级。 待改进:Qwen3.6 的原生 MTP 暂时搁置;与同一机器上的 Ollama 正面较量将于下次进行。

现已收录于 homebrew-core brew install rapid-mlx rapid-mlx chat qwen3.5-4b-4bit

采用 Apache-2.0 许可,原生基于 MLX。⭐ 3.4k Stars —— 欢迎找茬并告诉我们,issue 回复迅速。

相似文章

@cevenif: 用苹果电脑跑本地大模型的朋友,有个工具值得盯上——Rapid-MLX。它在 M 系列芯片上的推理速度比 Ollama 快 2 到 4 倍,因为它是直接基于苹果的 MLX 框架开发的,对芯片架构的压榨更彻底。 几个关键点: KV 缓存裁剪加…

X AI KOLs Timeline

Rapid-MLX 是一个针对苹果 M 系列芯片优化的本地大模型推理工具,基于 MLX 框架开发,推理速度比 Ollama 快 2 到 4 倍,支持多种模型、工具调用及 OpenAI API 兼容接口。