@akshay_pachaar: 从头开始训练你自己的LLM。这个仓库从头构建了一个GPT风格的Transformer,完全不用高级库…
摘要
一个从零开始构建GPT风格Transformer的仓库,不使用高级库,涵盖了从数据预处理到生成的整个过程,并包括SFT和RLHF的指南。
查看缓存全文
缓存时间: 2026/06/15 17:04
从零开始训练你自己的LLM。
这个仓库从头搭建了一个GPT风格的Transformer,没有使用任何高级库。
你可以清楚地看到注意力机制、多头注意力、前馈块、嵌入、残差连接和层归一化是如何组合在一起的。
而且它不止步于模型本身,而是走通了从原始数据到生成文本的完整路径。
↳ 数据下载、预处理、训练和生成
↳ 训练数据来自The Pile(825GB,22个来源)
↳ 使用tiktoken(r50k_base)进行分词,并存储为HDF5格式
↳ 训练循环包含评估、学习率衰减和防崩溃检查点
↳ 提供预训练之后的SFT和RLHF指南
同一份代码只需更改几个配置值即可扩展。大约1300万参数时,输出开始产生正确的语法和拼写,你可以在免费的Colab或Kaggle T4上训练大约一天。
如果你一直想亲眼看看Transformer是如何工作的,而不是直接导入一个现成的,那么这是一个很好的起点。
链接在评论中指向仓库。
对ML/AI工程感兴趣?查看我的免费AI工程指南手册,共380+页(已下载超过8万次,链接见下方)
相似文章
@sairahul1:没人告诉你GPT或Claude内部到底是什么。他们说“transformer”然后就略过了。这个仓库从头构建了一个……
一个仓库,从头构建transformer,不用高级库,解释注意力机制和完整训练流程,在免费Colab上一天内可训练。
rasbt/LLMs-from-scratch
该仓库提供开源代码,用于从零开始构建、预训练和微调一个类似GPT的大型语言模型,是Sebastian Raschka同名书籍的官方代码配套。
@_rohit_tiwari_:用PyTorch从头构建类似GPT的LLM > 将LLM架构拆分为简单部分 > 对初学者友好 > Fu…
一个对初学者友好的动手GitHub仓库,将类似GPT的LLM架构拆分为简单部分,包含10个Jupyter笔记本,涵盖分词、注意力机制、Transformer块以及用PyTorch实现的微型GPT。
@yibie: 推荐这个 repo,从零构建 GPT 风格 transformer,不用任何高级库。13M 参数就能产出语法正确的文本,在免费 Colab 的 T4 上一天就能训完。 从零训练自己的 LLM:13M 参数的 GPT 实现 Akshay 分…
推荐了一个从零构建GPT风格Transformer的GitHub仓库,无需高级库,13M参数即可在免费Colab上训练一天,生成语法正确的文本。
@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …
LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。