@jianchen1799: 本地模型现在可以处理智能体工作负载。本地推理引擎需要迎头赶上。今天我们发布 Splash: …
摘要
Inco AI 发布 Splash,一款针对 Apple silicon 优化的开源推理引擎,声称解码速度最高提升3倍,用于本地模型服务,使得 M5 Max MacBook Pro 等设备能够支持智能体工作负载。
查看缓存全文
缓存时间: 2026/09/19 19:11
本地模型现已能胜任智能体任务,本地推理引擎亟待升级。
今日我们正式推出 Splash:基于 DFlash2 打造、专为苹果芯片优化的模型服务方案。
速度达到次优引擎的2倍。以 Qwen3.8-27B 模型在 M5 Max 芯片上运行真实智能体任务为例,吞吐量最高可达 140 tokens/s。
Inco AI (@inco_ai): Qwen3.8-27B 在 M5 Max MacBook Pro 上跑出 144 tok/s ⚡
隆重推出 Inco Splash:我们围绕模型与苹果芯片构建的开源推理引擎。
解码速度最高可达 Ollama 的3倍、oMLX 的2倍,当智能体并行调用子智能体时速度可达近4倍。
相似文章
我为Apple Silicon打造了最快的本地AI引擎。专为代理式使用优化。
作者宣布发布'lightning-mlx',这是一个针对Apple Silicon优化的本地AI引擎,可为编码代理和工具调用工作流实现高令牌速度。
@rohanpaul_ai:苹果为本地推理迈出重大一步。他们刚刚推出M6和M5 Ultra,将更多AI推理转移到Mac桌面……
苹果推出了M6和M5 Ultra芯片,以在Mac桌面上实现先进的本地AI推理,配备高统一内存和计算规格,支持在设备上运行大型语言模型。
@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
本地模型优化(3 分钟阅读)
本文分析了在 MacBook Pro 上本地运行 AI 推理的可行性,对比了本地 Qwen 35B 模型与云端 Claude Opus 4.5。结论是,对于常规任务,本地模型速度快 2 倍,尽管在能力上略有差距,但仍是日常工作量中一半任务的实用选择。
在40核 M5 Max 上的 Splash:通过调优内核为你的芯片实现解码性能提升20%
本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。