Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度

Reddit r/LocalLLaMA 工具

摘要

Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。

介绍Inco Splash,这是一款围绕模型和Apple silicon构建的开源推理引擎。解码速度最高可达Ollama的3倍,oMLX的2倍,当智能体分发到子智能体时几乎可达4倍。要求:M3或更新机型,macOS 26.4+,36 GB内存。只需一条命令即可开始:brew install incoai/tap/splash splash serve --model incoai/Qwen3.8-27B-Splash。这就是全部设置。将你的智能体指向它,可与Claude Code、OpenCode、Codex或Hermes配合使用。更喜欢应用程序?它也已在LM Studio中提供。获取最新LM Studio Bionic版本:lmstudio.ai。设置 > 运行时,下载Splash,然后下载模型。相同的引擎,集成在应用中,用于在Mac上进行本地智能体工作。博客:inco.ai/blog/splash
查看原文

相似文章

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。