@Raullen:Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型可靠到足以运行你的代理工作流程,而不仅仅是演示…
摘要
Rapid-MLX 0.11.0 带来了显著的性能提升,包括前缀缓存和响应缓存,支持新的模型家族,如 HY3 295B MoE 和 Qwen3-Coder-Next 80B,引入了结构化输出,确保有效的工具调用,并添加了与 MCP 服务器的无缝集成,用于自主代理工作流程。
查看缓存全文
缓存时间: 2026/07/25 20:11
Rapid-MLX 0.11.0 发布!让 Apple Silicon 上的本地模型足够可靠,能运行你的智能体工作流,而不仅仅是演示。
性能 • 前缀缓存复用:首令牌生成时间从 13.1 秒降至 0.51 秒(对重复的 6k 令牌前缀提速 25.6 倍)。共享系统提示词无需重复预填充。单个会话节省了 38,032 个令牌。 • 响应缓存:从 656 毫秒降至 2 毫秒(加速 284 倍,字节完全相同,零 GPU 解码)。 • 吞吐量:Qwen3.5-4B-4bit 模型达到 152 tok/s。冷启动只需数秒。
“rapid-mlx chat” 已进化为真正的智能体。将其指向任何 MCP 服务器,它就能自主编排工具(例如,文件系统服务器 → 14 个工具 → list_directory → 给出答案),并配有实时工具活动界面。思考预算会在解码阶段强制结束,以保持响应迅捷。
5 个新模型系列 • HY3 295B MoE(原生 MTP 推测解码)、Qwen3-Coder-Next 80B、MiniCPM5、LFM2.x,以及一个实际可运行的 2 比特三元 Bonsai 模型。 • Kokoro TTS → Parakeet STT 闭环验证,字词准确无误。 • Qwen3-VL 视觉能力、KV 缓存导入/导出,以及基于 llguidance 的结构化输出。通过设计保证工具调用的模式合规。
如果你在本地模型上运行编码智能体,一定深知“几乎 JSON”的参数会把解析器搞崩。0.11.0 直接约束解码过程——模型无法输出格式错误的工具调用。 • 在 harmony/gpt-oss、qwen3_coder_xml、gemma4、deepseek_v3 以及 hermes 上已验证。 • 自动、强制与必需三种模式。默认开启,零额外标记。 • 关键点:现在对推理模型也生效!由于语法偏移问题,<工具调用> 标签不再破坏强制调用。
可靠性与坦诚不足之处 每次发布都会运行自动化的内部测试(5 个模型 × 11 项检查,在真实硬件上运行)。无效模式 → 返回 400。未知模型 → 返回 404 并提供可用选项。没有静默降级。 待改进:Qwen3.6 的原生 MTP 暂时搁置;与同一机器上的 Ollama 正面较量将于下次进行。
现已收录于 homebrew-core brew install rapid-mlx rapid-mlx chat qwen3.5-4b-4bit
采用 Apache-2.0 许可,原生基于 MLX。⭐ 3.4k Stars —— 欢迎找茬并告诉我们,issue 回复迅速。
相似文章
@cevenif: 用苹果电脑跑本地大模型的朋友,有个工具值得盯上——Rapid-MLX。它在 M 系列芯片上的推理速度比 Ollama 快 2 到 4 倍,因为它是直接基于苹果的 MLX 框架开发的,对芯片架构的压榨更彻底。 几个关键点: KV 缓存裁剪加…
Rapid-MLX 是一个针对苹果 M 系列芯片优化的本地大模型推理工具,基于 MLX 框架开发,推理速度比 Ollama 快 2 到 4 倍,支持多种模型、工具调用及 OpenAI API 兼容接口。
@Prince_Canuma:今天我们发布了最大规模的 MLX-VLM 更新:v0.6.0 ……并且我们正在提升。这次更新旨在将你的 Apple 设备……
MLX-VLM v0.6.0 已发布,新增推测解码、兼容 Anthropic API 的智能体服务器、新模型(DeepSeek V4、ZAYA1-VL 等)、图像生成/编辑以及音频输入支持,使 Apple 设备上能运行本地 AI 智能体。
@jundotkim: oMLX 0.3.9rc1 发布。亮点:- 低内存Mac保持稳定,不再被系统杀死 - DFlash 升级至…
oMLX 0.3.9rc1,一个为Apple Silicon Mac优化的LLM推理服务器,增加了低内存稳定性、分块预填充、多任务管理聊天等功能。
@lmcache: 𝐋𝐌𝐂𝐚𝐜𝐡𝐞 𝐯𝟎.𝟓.𝟏 𝐢𝐬 𝐡𝐞𝐫𝐞!
LMCache v0.5.1 已发布,新增对 MiniMax M3 的模型支持,新后端包括 AMD hipFile 和 XPU Docker,支持跨层级预取、Device-DAX L1 拆分、隐藏状态缓存,以及用于 vLLM 集成的算子自动化。
我为Apple Silicon打造了最快的本地AI引擎。专为代理式使用优化。
作者宣布发布'lightning-mlx',这是一个针对Apple Silicon优化的本地AI引擎,可为编码代理和工具调用工作流实现高令牌速度。