@Sumanth_077: 从零开始训练你自己的LLM!一个逐步指导你构建和训练transformer模型的仓库…

X AI KOLs Timeline 工具

摘要

一个逐步指导用户使用PyTorch从零构建和训练transformer模型的仓库,全面覆盖数据处理、训练及后训练技术如SFT和RLHF。

从零开始训练你自己的LLM! 一个逐步指导你使用PyTorch从零构建和训练transformer模型的仓库。从下载训练数据到生成文本。 架构从零开始构建,遵循原始论文'Attention is All You Need'。MLP、单头注意力、多头注意力、transformer块和完整的transformer模型 - 所有代码和解释都配有每个步骤的详细图表。 训练数据来自The Pile - 一个多样化的825GB开源数据集,涵盖书籍、文章、代码、网站等。仓库包含脚本用于下载、使用tiktoken预处理和分词、以HDF5格式存储,并输入训练批次。 你可以在单个Colab T4 GPU上训练一个13M参数的模型。在13M参数时,模型开始生成正确的语法和连贯的短句。对于十亿参数训练,你至少需要一个A100或RTX 4090。仓库包含完整的GPU兼容性表,让你清楚知道在你的硬件上能做什么。 包含一个完整的SFT和RLHF指南作为单独的notebook,以进一步利用你的训练模型。 关键能力: • 端到端流程:数据下载 → 预处理 → 训练 → 文本生成 • 使用PyTorch从零实现完整的transformer • 在单个GPU上训练从13M到2B+参数的模型 • 训练数据来自The Pile (825GB, 22个多样化数据集) • 通过tiktoken分词 (r50k_base) • 包含SFT和RLHF指南 100%开源。 我已经在回复中分享了链接!
查看原文
查看缓存全文

缓存时间: 2026/09/19 17:07

从零开始训练你自己的大语言模型!

这是一个分步指南代码库,将带你使用PyTorch从头构建并训练一个Transformer模型。内容涵盖从下载训练数据到生成文本的全过程。

架构严格遵循《Attention is All You Need》原始论文,从底层逐层搭建:多层感知机、单头注意力机制、多头注意力机制、Transformer模块,直至完整的Transformer模型——每一步都配有详细图解进行代码实现与原理说明。

训练数据来自The Pile——一个多样化的825GB开源数据集,涵盖书籍、文章、代码、网页等多种内容。代码库包含数据下载脚本、使用tiktoken进行预处理与分词、以HDF5格式存储数据,以及为训练提供批量数据的完整流程。

你可以在单个Colab T4 GPU上训练1300万参数的模型。1300万参数量级下,模型已能生成语法正确、连贯的短句。若要进行十亿参数级训练,则需要至少A100或RTX 4090显卡。代码库附有完整的GPU兼容性列表,帮助你明确自身硬件的支持能力。

另包含一个独立的SFT(监督微调)与RLHF(基于人类反馈的强化学习)完整指南笔记本,助你进一步提升已训练模型的能力。

核心特性:

• 端到端流程:数据下载 → 预处理 → 训练 → 文本生成 • 基于PyTorch的完整Transformer模型从头实现 • 支持在单GPU上训练1300万至20亿以上参数量模型 • 训练数据来自The Pile(825GB,包含22个多样化数据集) • 采用tiktoken(r50k_base版本)进行分词处理 • 附带SFT与RLHF完整指南

完全开源。

我已将链接发布在评论区!

相似文章

@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …

X AI KOLs Timeline

LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。