Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度
摘要
Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。
介绍Inco Splash,这是一款围绕模型和Apple silicon构建的开源推理引擎。解码速度最高可达Ollama的3倍,oMLX的2倍,当智能体分发到子智能体时几乎可达4倍。要求:M3或更新机型,macOS 26.4+,36 GB内存。只需一条命令即可开始:brew install incoai/tap/splash splash serve --model incoai/Qwen3.8-27B-Splash。这就是全部设置。将你的智能体指向它,可与Claude Code、OpenCode、Codex或Hermes配合使用。更喜欢应用程序?它也已在LM Studio中提供。获取最新LM Studio Bionic版本:lmstudio.ai。设置 > 运行时,下载Splash,然后下载模型。相同的引擎,集成在应用中,用于在Mac上进行本地智能体工作。博客:inco.ai/blog/splash
相似文章
在空气中超越光速:32GB M4 MacBook Air上的8-22 tg/s Qwen3.8-Flash-Next (Q4/Q4ish)
Cherenkov是一个新的Apple Silicon推理引擎,使用预测专家流和混合精度执行,实现对像Qwen3.8-Flash-Next这样的大型AI模型的高效内存受限推理。
Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍
mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。
@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
Qwen3.8-Flash-Next 针对 Mac 优化版
本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。
本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据
本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。