在40核 M5 Max 上的 Splash:通过调优内核为你的芯片实现解码性能提升20%
摘要
本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。
请注意,引擎的默认内核规则是在较小芯片(16/20核 M5 和 32核 M4 Max)上测量的,因此40核 M5 Max 运行时可能是猜测的。Splash 的代码库包含一个开发者工具,“make tune-kernels”,它可以测试你的硬件上每种可用方式运行每个量化矩阵乘法。在我的机器上,它发现“split-K”布局(每个输入行被分成四路,部分和在最后合并)对于检查草稿令牌的8行步骤要快得多。已在 Inco 上撰写报告(https://github.com/incoai/splash/issues/154)。与此同时,试试看:从源代码构建 Splash(git clone https://github.com/incoai/splash, git checkout 1.0.2, make;需要 Xcode 26+ 和 Metal 工具链),然后在空闲的 Mac 上运行 build/engine-tests/tune-kernels build/splash.metallib <你的模型文件夹> --confirm。--confirm 步骤会告诉你获胜者是否真的加速了芯片上的整个前向传播。使用你选择的模型进行修补。Swift 模型转换也在此 hugging face 上可用:https://huggingface.co/SiliconSpecies/Swift-1.5-Qwen3.8-27B-Splash
相似文章
@jianchen1799: 本地模型现在可以处理智能体工作负载。本地推理引擎需要迎头赶上。今天我们发布 Splash: …
Inco AI 发布 Splash,一款针对 Apple silicon 优化的开源推理引擎,声称解码速度最高提升3倍,用于本地模型服务,使得 M5 Max MacBook Pro 等设备能够支持智能体工作负载。
Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度
Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。
@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
Apple M5 尚未充分利用其矩阵乘法核心
Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。
Apple M3 Ultra上实时扩散模型推理的系统优化
本文对Apple M3 Ultra上的实时扩散模型推理进行了系统优化研究,通过CoreML转换和蒸馏模型在512x512分辨率下达到了22.7 FPS,揭示了针对CUDA优化的技术无法直接迁移到Apple统一内存架构。