@ggerganov: 直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。
摘要
这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。
查看缓存全文
缓存时间: 2026/09/24 00:18
直接在 transformers 中运行 GGUF 模型。这项工作将 ggml 的 Metal 内核引入 transformers 生态系统,提升了兼容性和性能。更多详情如下。
是的。ggml CUDA 后端已经初步支持 MXFP4/NVFP4 激活值(仅当硬件原生支持时)。FP8 目前处于规划/讨论阶段。
@ggerganov 在 transformers 中通过 ggml Metal 内核运行 GGUF 检查点是一个实际的产品优势——相同的本地权重,增加了在 Mac 上运行的方式。
目前仍未明确的一点是:能否放入内存与实际体验是两个不同的检查。对于稠密的约 27B Q4_K_M 模型进行桌面估算(估计值,并非基准测试):文件大小约 16.4 GB → 加上 8k 上下文 + 运行时开销后约 21.3 GB(增加约 30%)。在 Mac Studio M5 Max 128 GB(约 28.1 tok/s)和 RTX 5090(约 82.1 tok/s)上都“能放入内存”——但体验差异取决于带宽。
想要这两个关键数值的计算吗——能否放入内存,以及运行速度是多少 tok/s?点击此处学习计算方法:
相似文章
@julien_c:transformers 与 @ggml_org 合作
Transformers 与 ggml_org 合作,将 GGML 内核集成到 transformers 库中,使 GGUF 文件加载的性能水平与 llama.cpp 相当。
transformers 原生支持 GGUF 格式!
Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。
Transformers 现在支持 llama.cpp 量化模型
Hugging Face 的 Transformers 库现在支持来自 llama.cpp 的 GGUF 模型,通过熟悉的 API 实现消费级硬件上的高效本地推理。
@UnslothAI: 我们让 GLM-5.3-Flash 在本地运行速度提升3.3倍!本地 GGUF 推理现在快1.6–3.4倍,通过优化解码和…
Unsloth AI 宣布对 GLM-5.3-Flash 进行优化,实现1.6–3.4倍更快的本地 GGUF 推理,支持多令牌预测和运行本地模型的硬件要求。
@no_stp_on_snek:turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列
LocalAI 新增 turboquant+ 后端,可在不升级硬件的情况下为 GGUF 模型提供更长上下文支持。