metal-kernels

标签

Cards List
#metal-kernels

@jundotkim: oMLX 0.5.2 已发布。(很抱歉沉默了这么久!)https://github.com/jundot/omlx/releases… oMLX 是最方便的...

X AI KOLs Timeline · 5天前 缓存

oMLX 0.5.2 版本新增了实时菜单栏活动、重新组织的模型菜单、Bonsai 低位内核,以及通过自定义 Metal 内核和原生推测解码实现的性能提升,使其成为在 Mac 上运行 MLX 模型的最快方式。

0 人收藏 0 人点赞
#metal-kernels

@no_stp_on_snek:在自定义Rust内核和Swift调度领域忙碌的一晚。9个PR中有3个是真正新增或修改的Metal内核……

X AI KOLs Timeline · 2026-07-07 缓存

在自定义Rust内核和Swift调度逻辑的优化下,Qwen3.6-35b-A3B模型的预填速度在2k提示下从255 tok/s提升到1058 tok/s,实现了约4倍的加速,解码和困惑度未受影响。

0 人收藏 0 人点赞
#metal-kernels

INT3 压缩与融合 Metal 内核 [R]

Reddit r/MachineLearning · 2026-04-22

独立研究者发布了 Spiral,这是一款专为 Apple Silicon 设计、利用自定义融合 Metal 内核将大语言模型(LLM)压缩至 INT3、KV 缓存压缩至 INT2 的工具,目前已提供 Qwen-7B 预览版。

0 人收藏 0 人点赞
#metal-kernels

@bstnxbt:DFlash v0.1.4:为量化版 Qwen3 混合模型提供自定义 Metal 验证内核,并显著降低峰值内存占用……

X AI KOLs Following · 2026-04-18 缓存

DFlash v0.1.4 发布了面向量化版 Qwen3 混合模型的自定义 Metal 验证内核,在 M5 Max GPU 上可显著降低峰值内存占用,并在长上下文场景下实现 2.2 倍吞吐量提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈