@akshay_pachaar: 从头开始训练你自己的LLM。这个仓库从头构建了一个GPT风格的Transformer,完全不用高级库…

X AI KOLs Following 工具

摘要

一个从零开始构建GPT风格Transformer的仓库,不使用高级库,涵盖了从数据预处理到生成的整个过程,并包括SFT和RLHF的指南。

从头开始训练你自己的LLM。 这个仓库从头构建了一个GPT风格的Transformer,完全不用高级库。 你可以清楚地看到注意力机制、多头注意力、前馈块、嵌入、残差连接和层归一化是如何组合在一起的。 而且它不止于模型本身。它展示了从原始数据到生成文本的完整路径。 ↳ 数据下载、预处理、训练和生成 ↳ 训练数据来自The Pile(825GB,涵盖22个来源) ↳ 使用tiktoken (r50k_base) 分词,并存储在HDF5中 ↳ 训练循环包含评估、学习率衰减和崩溃安全检查点 ↳ 预训练之后,还有SFT和RLHF指南 同样的代码,只需更改几个配置值即可扩展规模。大约1300万参数时,输出开始产生正确的语法和拼写,你可以在免费的Colab或Kaggle T4上大约一天内完成训练。 如果你曾经想真正了解Transformer是如何工作的,而不是直接导入一个现成的,那么这是一个很好的起点。 仓库链接在评论中。 对ML/AI工程感兴趣?查看我的免费AI工程指南书,共380多页(已下载超过8万次,链接如下)
查看原文
查看缓存全文

缓存时间: 2026/06/15 17:04

从零开始训练你自己的LLM。

这个仓库从头搭建了一个GPT风格的Transformer,没有使用任何高级库。

你可以清楚地看到注意力机制、多头注意力、前馈块、嵌入、残差连接和层归一化是如何组合在一起的。

而且它不止步于模型本身,而是走通了从原始数据到生成文本的完整路径。

↳ 数据下载、预处理、训练和生成
↳ 训练数据来自The Pile(825GB,22个来源)
↳ 使用tiktoken(r50k_base)进行分词,并存储为HDF5格式
↳ 训练循环包含评估、学习率衰减和防崩溃检查点
↳ 提供预训练之后的SFT和RLHF指南

同一份代码只需更改几个配置值即可扩展。大约1300万参数时,输出开始产生正确的语法和拼写,你可以在免费的Colab或Kaggle T4上训练大约一天。

如果你一直想亲眼看看Transformer是如何工作的,而不是直接导入一个现成的,那么这是一个很好的起点。

链接在评论中指向仓库。

对ML/AI工程感兴趣?查看我的免费AI工程指南手册,共380+页(已下载超过8万次,链接见下方)

相似文章

rasbt/LLMs-from-scratch

GitHub Trending (daily)

该仓库提供开源代码,用于从零开始构建、预训练和微调一个类似GPT的大型语言模型,是Sebastian Raschka同名书籍的官方代码配套。

@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …

X AI KOLs Timeline

LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。