@julien_c:transformers 与 @ggml_org 合作
摘要
Transformers 与 ggml_org 合作,将 GGML 内核集成到 transformers 库中,使 GGUF 文件加载的性能水平与 llama.cpp 相当。
查看缓存全文
缓存时间: 2026/09/23 12:05
transformers 与 @ggml_org 携手合作 🐐
Lysandre (@LysandreJik): Transformers 多年前已支持通过反量化方式加载 GGUF 文件。
感谢 @_marcsun 的贡献,我们现在通过
kernels库调用 GGML 内核,实现了与 llama.cpp 相媲美的运行性能。衷心感谢整个 @ggml_org 团队开发这些内核!
相似文章
Transformers 现在支持 llama.cpp 量化模型
Hugging Face 的 Transformers 库现在支持来自 llama.cpp 的 GGUF 模型,通过熟悉的 API 实现消费级硬件上的高效本地推理。
@ggerganov: 直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。
这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。
transformers 原生支持 GGUF 格式!
Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。
GGML 和 llama.cpp 加入 Hugging Face,保障本地 AI 长期发展
GGML 和 llama.cpp 已加入 Hugging Face,以确保本地 AI 开发的长期可持续性。Georgi Gerganov 的团队将保持对项目的完全自主权,同时获得资源来扩大社区支持并改进 llama.cpp 推理与 transformers 模型定义之间的集成。
huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
Hugging Face 上发布了已消除限制的 GLM-5.2 模型的量化 GGUF 版本,可使用 Transformers、llama.cpp 和 vLLM 等工具进行本地推理。