标签
本文介绍了一个专为 Apple Silicon 优化的 Automatic1111 分支,加入了 Metal 优化(例如 Metal Flash Attention),以加速 Stable Diffusion 1.5 的生成速度,在 M3 Pro 上将时间从 8-10 秒缩短至 3-7 秒,在 M1 Mac Mini 上从 13-20 秒缩短至 8-10 秒。
Antirez 的 h3.c 是面向 Apple Silicon 的 MiniMax-H3 原生极简推理引擎,提供快速、端到端的提示词到视频/音频管线,并带有 Metal 优化和交互式会话。目前专注于 M3 Max 和 M5 Max 的性能和内存优化。
Redis creator antirez releases h3.c, a pure C + Metal inference engine for MiniMax H3 that runs natively on Apple Silicon, enabling text-to-video/audio without Python, PyTorch, or ComfyUI.
Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。
Shitty 是一个快速、开源的终端模拟器,使用 Vulkan/Metal 进行 GPU 渲染,并声称在基准测试中吞吐量高于 Alacritty、Kitty 和 Ghostty。
TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。
作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。
一位开发者分享了他们实现的无绑定GPU抽象层Loon GPU,它基于Vulkan 1.3和Metal 4,灵感来自Sebastian Aaltonen的《No Graphics API》博客文章。该库使用GPU指针、顶点拉取和无绑定纹理堆来简化现代图形API。
QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。
QuixiAI 将 ThunderKittens 和 ThunderMittens 更名为 QuixiCore-CUDA 和 QuixiCore-Metal,打造统一的跨平台内核家族,用于 AI 工作负载。
QuixiAI 将 ThunderKittens 移植到了 Metal,从而在 MPS 和 MLX 上实现了内核支持,使得可以在 Mac 上训练模型。
作者描述了如何在 macOS 上使用 Metal、在 Linux 上使用 OpenGL 为 Emacs 构建基于 GPU 的显示后端,从而提升渲染性能并启用视频播放和动画光标等新效果,且无需修改核心重新显示引擎。
将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。
zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。
Rigel是对Apple M4 Max GPU上Metal 4.1张量计算路径的经验性表征,揭示了fp8 matmul2d是模拟的(而非硬件加速),该操作完全在GPU着色器核心上执行,没有专用的矩阵数据路径,并重构了不透明的协作张量片段布局。
safetensors 0.8.0 版本带来了重大性能提升:通过 dlpack 直接复制到 Metal MTLBuffers,实现 2-3 倍的加载速度提升,并修复了 macOS 上的 OOM 问题;同时支持无 GIL 序列化,加快多文件保存速度。
GenBench 是一款免费的 iOS 应用,允许用户使用 llama.cpp 和 Metal 在 iPhone/iPad 上下载、运行和基准测试 GGUF 模型,支持离线聊天、标准化基准测试和全球排行榜等功能。
用户分享在Mac上使用llama.cpp配合GGUF Q4_K_M量化版Gemma-4-12b模型的经验,实现了约36 tok/s的本地推理速度和约10GB内存占用。
在 Hugging Face 上发布了一个内核,通过使用分块评分和 SIMD 组矩阵运算(Metal 和 WMMA)来加速 MaxSim 后期交互检索,比朴素实现获得了 3–5 倍的加速。