@DanKornas:停止每次测试新预训练模型时都编写不同的集成代码。Transformers 是一个模型定义框架……
摘要
Transformers 是一个模型定义框架,提供统一的 API 和集中化的模型定义,用于跨模态运行预训练模型,从检查点到推理或训练。
查看缓存全文
缓存时间: 2026/07/29 13:58
每次测试一个新预训练模型时,不必再为不同集成分别编写代码。
Transformers 是一个面向工程师和研究人员的模型定义框架,支持在文本、视觉、音频、视频及多模态任务中训练或运行预训练模型。
它通过统一的 API 和集中的模型定义,帮助你从模型检查点快速切换到推理或训练,这些定义可跨训练框架、推理引擎以及相邻建模库使用。
主要特性: • Pipeline API – 处理输入预处理并返回适合任务的输出。 • 多模态覆盖 – 支持文本、音频、视觉、视频及多模态任务。 • 共享模型定义 – 将支持的模型与 Axolotl、DeepSpeed、vLLM、llama.cpp 等工具连接。 • 可重用检查点 – 下载并缓存你选择的 Hub 模型以供后续使用。 • 可定制内部机制 – 一致地暴露模型内部结构,并允许模型文件独立用于实验。
它是开源的(Apache 2.0 许可证)。
回复中的链接
相似文章
@NFTCPS: 天天喊着搞AI,结果你连Transformer是个啥都说不清? 有个仓库够狠,从零手搓一个GPT,不调任何高级库。Attention、多头、前馈、Embedding、残差、Layer Norm,怎么拼起来的全摊给你看。而且不止模型,整条链…
一个GitHub开源项目,从零实现完整的GPT训练流程,包含数据预处理、预训练、SFT和RLHF后训练,全部基于原生PyTorch,适合想深入理解Transformer原理的开发者。
并行化Transformer训练(39分钟阅读)
一个交互式、可探索的解释,介绍各种用于训练Transformer的并行化方案,改编自关于模型扩展的学术内容。
@TeachTheMachine: 使用Transformer模型:从训练到推理
本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。
HuggingFace的Transformers:最先进的自然语言处理
本文介绍了Transformers库,这是一个开源库,在统一API下提供最先进的Transformer架构和预训练模型,旨在使先进的自然语言处理对更广泛的机器学习社区可及。
@TheTuringPost: 一个理解或复习Transformer架构的绝佳资源。它解释了Transformer如何逐个token处理文本…
推荐一个解释Transformer架构的教育资源,涵盖token嵌入、自注意力、残差连接,以及与GPT和BERT的联系。