@ggerganov: 直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。

X AI KOLs Timeline 工具

摘要

这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。

直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。更多信息如下
查看原文
查看缓存全文

缓存时间: 2026/09/24 00:18

直接在 transformers 中运行 GGUF 模型。这项工作将 ggml 的 Metal 内核引入 transformers 生态系统,提升了兼容性和性能。更多详情如下。

是的。ggml CUDA 后端已经初步支持 MXFP4/NVFP4 激活值(仅当硬件原生支持时)。FP8 目前处于规划/讨论阶段。

@ggerganov 在 transformers 中通过 ggml Metal 内核运行 GGUF 检查点是一个实际的产品优势——相同的本地权重,增加了在 Mac 上运行的方式。

目前仍未明确的一点是:能否放入内存与实际体验是两个不同的检查。对于稠密的约 27B Q4_K_M 模型进行桌面估算(估计值,并非基准测试):文件大小约 16.4 GB → 加上 8k 上下文 + 运行时开销后约 21.3 GB(增加约 30%)。在 Mac Studio M5 Max 128 GB(约 28.1 tok/s)和 RTX 5090(约 82.1 tok/s)上都“能放入内存”——但体验差异取决于带宽。

想要这两个关键数值的计算吗——能否放入内存,以及运行速度是多少 tok/s?点击此处学习计算方法:

相似文章

transformers 原生支持 GGUF 格式!

Reddit r/LocalLLaMA

Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。