metal

标签

Cards List
#metal

适用于 Apple Metal 的 Automatic1111,sd1.5 速度提升 40%

Hacker News Top · 3天前 缓存

本文介绍了一个专为 Apple Silicon 优化的 Automatic1111 分支,加入了 Metal 优化(例如 Metal Flash Attention),以加速 Stable Diffusion 1.5 的生成速度,在 M3 Pro 上将时间从 8-10 秒缩短至 3-7 秒,在 M1 Mac Mini 上从 13-20 秒缩短至 8-10 秒。

0 人收藏 0 人点赞
#metal

Antirez/h3.c: 面向 Mac 电脑的 MiniMax H3 推理引擎

Hacker News Top · 5天前 缓存

Antirez 的 h3.c 是面向 Apple Silicon 的 MiniMax-H3 原生极简推理引擎,提供快速、端到端的提示词到视频/音频管线,并带有 Metal 优化和交互式会话。目前专注于 M3 Max 和 M5 Max 的性能和内存优化。

0 人收藏 0 人点赞
#metal

@eternityspring: MiniMax H3 本地爆火,可教程清一色 NVIDIA + ComfyUI,Mac 用户只能干瞪眼。 现在 Redis 之父 antirez 看不下去,自己用纯 C + Metal 手写了一个 H3 推理引擎,Apple Silico…

X AI KOLs Timeline · 5天前 缓存

Redis creator antirez releases h3.c, a pure C + Metal inference engine for MiniMax H3 that runs natively on Apple Silicon, enabling text-to-video/audio without Python, PyTorch, or ComfyUI.

0 人收藏 0 人点赞
#metal

Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s

Reddit r/LocalLLaMA · 2026-08-05

Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。

0 人收藏 0 人点赞
#metal

Show HN: Shitty – 快速终端。内存不安全,而且比你的快

Hacker News Top · 2026-08-02 缓存

Shitty 是一个快速、开源的终端模拟器,使用 Vulkan/Metal 进行 GPU 渲染,并声称在基准测试中吞吐量高于 Alacritty、Kitty 和 Ghostty。

0 人收藏 0 人点赞
#metal

Show HN:开源引擎,可在任何M系列Mac上用2GB内存运行Gemma 4 26B

Hacker News Top · 2026-07-29 缓存

TurboFieldfare 是一个开源的 Swift+Metal 运行时,通过从 SSD 流式加载专家权重,在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 模型,仅需约 2GB 内存,从而在 8GB 内存的机器上实现推理。

0 人收藏 0 人点赞
#metal

@no_stp_on_snek: 还有人谈论 mlx-swift-lm 吗?说我在休息一天……清理了鸡舍,锻炼了一下,然后…

X AI KOLs Following · 2026-07-16 缓存

作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。

0 人收藏 0 人点赞
#metal

编写一个无绑定GPU抽象层

Hacker News Top · 2026-07-09 缓存

一位开发者分享了他们实现的无绑定GPU抽象层Loon GPU,它基于Vulkan 1.3和Metal 4,灵感来自Sebastian Aaltonen的《No Graphics API》博客文章。该库使用GPU指针、顶点拉取和无绑定纹理堆来简化现代图形API。

0 人收藏 0 人点赞
#metal

@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611

X AI KOLs Following · 2026-07-06 缓存

QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。

0 人收藏 0 人点赞
#metal

@QuixiAI:QuixiAI/ThunderKittens 和 QuixiAI/ThunderMittens 现已更名为 QuixiCore-CUDA 和 QuixiCore-Metal。发布 Qu…

X AI KOLs Following · 2026-07-06 缓存

QuixiAI 将 ThunderKittens 和 ThunderMittens 更名为 QuixiCore-CUDA 和 QuixiCore-Metal,打造统一的跨平台内核家族,用于 AI 工作负载。

0 人收藏 0 人点赞
#metal

@QuixiAI: QuixiAI/ThunderMittens(从 @HazyResearch 分支)将 ThunderKittens(以及几乎所有其他内容)移植到 Metal。现在可以…

X AI KOLs Following · 2026-06-29 缓存

QuixiAI 将 ThunderKittens 移植到了 Metal,从而在 MPS 和 MLX 上实现了内核支持,使得可以在 Mac 上训练模型。

0 人收藏 0 人点赞
#metal

我为 Emacs 构建了一个 GPU 后端

Hacker News Top · 2026-06-23 缓存

作者描述了如何在 macOS 上使用 Metal、在 Linux 上使用 OpenGL 为 Emacs 构建基于 GPU 的显示后端,从而提升渲染性能并启用视频播放和动画光标等新效果,且无需修改核心重新显示引擎。

0 人收藏 0 人点赞
#metal

我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3

Reddit r/LocalLLaMA · 2026-06-15

将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。

0 人收藏 0 人点赞
#metal

@steeve:又是5天后,zml/llmd完全在Metal上运行,以完整bf16精度服务8个并发请求 zml/llmd是我们的大语言模型服务…

X AI KOLs Following · 2026-06-13 缓存

zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。

0 人收藏 0 人点赞
#metal

Rigel:逆向工程Apple M4 Max GPU上的Metal 4.1张量计算路径

arXiv cs.CL · 2026-06-12 缓存

Rigel是对Apple M4 Max GPU上Metal 4.1张量计算路径的经验性表征,揭示了fp8 matmul2d是模拟的(而非硬件加速),该操作完全在GPU着色器核心上执行,没有专用的矩阵数据路径,并重构了不透明的协作张量片段布局。

0 人收藏 0 人点赞
#metal

@LucSGeorges: 性能满载版本:safetensors 0.8.0 发布。主要亮点:- 直接复制到 Metal MTLBuffers + 使用 dlpack 实现零拷贝…

X AI KOLs Following · 2026-06-09 缓存

safetensors 0.8.0 版本带来了重大性能提升:通过 dlpack 直接复制到 Metal MTLBuffers,实现 2-3 倍的加载速度提升,并修复了 macOS 上的 OOM 问题;同时支持无 GIL 序列化,加快多文件保存速度。

0 人收藏 0 人点赞
#metal

我开发了一款 iOS 应用,可以在你的 iPhone/iPad 上对 GGUF 模型进行基准测试

Reddit r/LocalLLaMA · 2026-06-05

GenBench 是一款免费的 iOS 应用,允许用户使用 llama.cpp 和 Metal 在 iPhone/iPad 上下载、运行和基准测试 GGUF 模型,支持离线聊天、标准化基准测试和全球排行榜等功能。

0 人收藏 0 人点赞
#metal

@mylifcc: 我已经在mac上用上Gemma-4-12b了,技术栈是: llama.cpp + GGUF Q4_K_M + Metal 32K context,本地 OpenAI-compatible API 实测约 36 tok/s,常驻 RSS 约…

X AI KOLs Timeline · 2026-06-03 缓存

用户分享在Mac上使用llama.cpp配合GGUF Q4_K_M量化版Gemma-4-12b模型的经验,实现了约36 tok/s的本地推理速度和约10GB内存占用。

0 人收藏 0 人点赞
#metal

金属地图

Hacker News Top · 2026-05-20

一张交互式地图,展示重金属音乐的子流派。

0 人收藏 0 人点赞
#metal

在@huggingface上发布我的第一个内核:MaxSim后期交互检索(ColBERT / PyLate)的瓶颈在于材料……

X AI KOLs Following · 2026-05-18 缓存

在 Hugging Face 上发布了一个内核,通过使用分块评分和 SIMD 组矩阵运算(Metal 和 WMMA)来加速 MaxSim 后期交互检索,比朴素实现获得了 3–5 倍的加速。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈