在40核 M5 Max 上的 Splash:通过调优内核为你的芯片实现解码性能提升20%

Reddit r/LocalLLaMA 工具

摘要

本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。

请注意,引擎的默认内核规则是在较小芯片(16/20核 M5 和 32核 M4 Max)上测量的,因此40核 M5 Max 运行时可能是猜测的。Splash 的代码库包含一个开发者工具,“make tune-kernels”,它可以测试你的硬件上每种可用方式运行每个量化矩阵乘法。在我的机器上,它发现“split-K”布局(每个输入行被分成四路,部分和在最后合并)对于检查草稿令牌的8行步骤要快得多。已在 Inco 上撰写报告(https://github.com/incoai/splash/issues/154)。与此同时,试试看:从源代码构建 Splash(git clone https://github.com/incoai/splash, git checkout 1.0.2, make;需要 Xcode 26+ 和 Metal 工具链),然后在空闲的 Mac 上运行 build/engine-tests/tune-kernels build/splash.metallib <你的模型文件夹> --confirm。--confirm 步骤会告诉你获胜者是否真的加速了芯片上的整个前向传播。使用你选择的模型进行修补。Swift 模型转换也在此 hugging face 上可用:https://huggingface.co/SiliconSpecies/Swift-1.5-Qwen3.8-27B-Splash
查看原文

相似文章

Apple M5 尚未充分利用其矩阵乘法核心

Reddit r/LocalLLaMA

Apple M5 芯片支持矩阵乘法中的 INT8 激活,但 MLX 和 Llama.cpp 等推理后端目前仍使用 16 位;自定义 w8a8 内核在 Gemma4 预填充任务上实现了高达 1.4 倍的加速。

Apple M3 Ultra上实时扩散模型推理的系统优化

arXiv cs.LG

本文对Apple M3 Ultra上的实时扩散模型推理进行了系统优化研究,通过CoreML转换和蒸馏模型在512x512分辨率下达到了22.7 FPS,揭示了针对CUDA优化的技术无法直接迁移到Apple统一内存架构。