@LucSGeorges: 性能满载版本:safetensors 0.8.0 发布。主要亮点:- 直接复制到 Metal MTLBuffers + 使用 dlpack 实现零拷贝…
摘要
safetensors 0.8.0 版本带来了重大性能提升:通过 dlpack 直接复制到 Metal MTLBuffers,实现 2-3 倍的加载速度提升,并修复了 macOS 上的 OOM 问题;同时支持无 GIL 序列化,加快多文件保存速度。
查看缓存全文
缓存时间: 2026/06/10 13:51
perf packed release: safetensors 0.8.0 正式发布
主要亮点:
-
直接拷贝到 Metal MTLBuffer + DLPack,实现零拷贝交付到目标框架(目前仅支持 torch) -> 性能提升 2-3 倍,并修复了在 macOS 上使用 transformers 加载接近统一内存限制的模型时出现的 OOM 问题
-
无 GIL 序列化,支持从 Python 进行多线程保存 -> 单个文件保存速度提升 1.2~2 倍,并行保存多个文件时预计会有更显著的提升!
查看发布说明获取完整改进列表!
相似文章
@Youssofal_:MTPLX V0.3 已发布!- 我意识到 M1 和 M2 Mac 并不支持 BF16,之前只是在模拟该格式,导致每秒生成的 tokens 数(TPS)显著下降……
MTPLX v0.3 已发布,这是一个专为 Apple Silicon 设计的原生运行时。它采用多 token 预测(MTP)技术将解码速度提高一倍,并通过 Leviathan-Chen 接受机制维持分布准确性。
@bstnxbt:DFlash v0.1.4:为量化版 Qwen3 混合模型提供自定义 Metal 验证内核,并显著降低峰值内存占用……
DFlash v0.1.4 发布了面向量化版 Qwen3 混合模型的自定义 Metal 验证内核,在 M5 Max GPU 上可显著降低峰值内存占用,并在长上下文场景下实现 2.2 倍吞吐量提升。
@jundotkim: oMLX 0.3.9rc1 发布。亮点:- 低内存Mac保持稳定,不再被系统杀死 - DFlash 升级至…
oMLX 0.3.9rc1,一个为Apple Silicon Mac优化的LLM推理服务器,增加了低内存稳定性、分块预填充、多任务管理聊天等功能。
@jundotkim: oMLX 0.5.2 已发布。(很抱歉沉默了这么久!)https://github.com/jundot/omlx/releases… oMLX 是最方便的...
oMLX 0.5.2 版本新增了实时菜单栏活动、重新组织的模型菜单、Bonsai 低位内核,以及通过自定义 Metal 内核和原生推测解码实现的性能提升,使其成为在 Mac 上运行 MLX 模型的最快方式。
@no_stp_on_snek: 还有人谈论 mlx-swift-lm 吗?说我在休息一天……清理了鸡舍,锻炼了一下,然后…
作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。