@jianchen1799: 本地模型现在可以处理智能体工作负载。本地推理引擎需要迎头赶上。今天我们发布 Splash: …

X AI KOLs Timeline 工具

摘要

Inco AI 发布 Splash,一款针对 Apple silicon 优化的开源推理引擎,声称解码速度最高提升3倍,用于本地模型服务,使得 M5 Max MacBook Pro 等设备能够支持智能体工作负载。

本地模型现在可以处理智能体工作负载。本地推理引擎需要迎头赶上。 今天我们发布 Splash:模型优化的 Apple silicon 服务,由 DFlash2 驱动。 比次快引擎快2倍。Qwen3.8-27B:在 M5 Max 上实时智能体服务中最高可达140 tokens/s。
查看原文
查看缓存全文

缓存时间: 2026/09/19 19:11

本地模型现已能胜任智能体任务,本地推理引擎亟待升级。

今日我们正式推出 Splash:基于 DFlash2 打造、专为苹果芯片优化的模型服务方案。

速度达到次优引擎的2倍。以 Qwen3.8-27B 模型在 M5 Max 芯片上运行真实智能体任务为例,吞吐量最高可达 140 tokens/s。

Inco AI (@inco_ai): Qwen3.8-27B 在 M5 Max MacBook Pro 上跑出 144 tok/s ⚡

隆重推出 Inco Splash:我们围绕模型与苹果芯片构建的开源推理引擎。

解码速度最高可达 Ollama 的3倍、oMLX 的2倍,当智能体并行调用子智能体时速度可达近4倍。

相似文章

本地模型优化(3 分钟阅读)

TLDR AI

本文分析了在 MacBook Pro 上本地运行 AI 推理的可行性,对比了本地 Qwen 35B 模型与云端 Claude Opus 4.5。结论是,对于常规任务,本地模型速度快 2 倍,尽管在能力上略有差距,但仍是日常工作量中一半任务的实用选择。