@Sumanth_077: 从零开始训练你自己的LLM!一个逐步指导你构建和训练transformer模型的仓库…
摘要
一个逐步指导用户使用PyTorch从零构建和训练transformer模型的仓库,全面覆盖数据处理、训练及后训练技术如SFT和RLHF。
查看缓存全文
缓存时间: 2026/09/19 17:07
从零开始训练你自己的大语言模型!
这是一个分步指南代码库,将带你使用PyTorch从头构建并训练一个Transformer模型。内容涵盖从下载训练数据到生成文本的全过程。
架构严格遵循《Attention is All You Need》原始论文,从底层逐层搭建:多层感知机、单头注意力机制、多头注意力机制、Transformer模块,直至完整的Transformer模型——每一步都配有详细图解进行代码实现与原理说明。
训练数据来自The Pile——一个多样化的825GB开源数据集,涵盖书籍、文章、代码、网页等多种内容。代码库包含数据下载脚本、使用tiktoken进行预处理与分词、以HDF5格式存储数据,以及为训练提供批量数据的完整流程。
你可以在单个Colab T4 GPU上训练1300万参数的模型。1300万参数量级下,模型已能生成语法正确、连贯的短句。若要进行十亿参数级训练,则需要至少A100或RTX 4090显卡。代码库附有完整的GPU兼容性列表,帮助你明确自身硬件的支持能力。
另包含一个独立的SFT(监督微调)与RLHF(基于人类反馈的强化学习)完整指南笔记本,助你进一步提升已训练模型的能力。
核心特性:
• 端到端流程:数据下载 → 预处理 → 训练 → 文本生成 • 基于PyTorch的完整Transformer模型从头实现 • 支持在单GPU上训练1300万至20亿以上参数量模型 • 训练数据来自The Pile(825GB,包含22个多样化数据集) • 采用tiktoken(r50k_base版本)进行分词处理 • 附带SFT与RLHF完整指南
完全开源。
我已将链接发布在评论区!
相似文章
@akshay_pachaar: 从头开始训练你自己的LLM。这个仓库从头构建了一个GPT风格的Transformer,完全不用高级库…
一个从零开始构建GPT风格Transformer的仓库,不使用高级库,涵盖了从数据预处理到生成的整个过程,并包括SFT和RLHF的指南。
@DanKornas:不要通过零散的教程学习 LLM。LLM from Scratch 是一个面向开发者的实践性 PyTorch 课程,适合那些想要……
一个实践性 PyTorch 课程,教授从 Transformer 基础到微调和对齐的 LLM 训练,包括 RLHF 和 GRPO。
@Fluyeporlaweb:这位天才在 GitHub 上发布了一份逐步指南,教你从零开始构建和训练自己的模型。没有魔法……
Fluyeporlaweb 在 GitHub 上发布了一份指南,展示如何从零开始构建和训练 Transformer 模型,实现了注意力机制、多头注意力、嵌入以及训练后算法(SFT、PPO、DPO、GRPO),无需使用高级库,并在 The Pile 数据集上训练。
@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …
LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。
@sairahul1:没人告诉你GPT或Claude内部到底是什么。他们说“transformer”然后就略过了。这个仓库从头构建了一个……
一个仓库,从头构建transformer,不用高级库,解释注意力机制和完整训练流程,在免费Colab上一天内可训练。