Hi Reddit, I posted my Build Your Own LLM workshop to Youtube (GPT2 & Qwen3.6 style)
摘要
Justin Angel 发布了一个完整的 YouTube 工作坊,教你从零构建自己的大语言模型(基于 GPT-2 和 Qwen3.6 风格),涵盖 Transformer 架构、训练流程,并提供 Excel 手动操作和 Python/PyTorch 代码实践,无需数学或 ML 先修知识。
Hi internet friends, I recorded a workshop about building your own LLM without any math / ML prerequisites. It covers everything from machine learning fundamentals, deep neural networks, transformer architecture, and pre/post-training. The only prerequisite is being comfortable with learning through code & excel examples. 1. [**Sampling** Large Language Models](https://www.youtube.com/watch?v=vXiB0UdDhk8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 2. [**Reverse Engineering** Large Language Model](https://www.youtube.com/watch?v=E0rkgxwhz5g&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 3. [**Perceptrons:** wx+b](https://www.youtube.com/watch?v=uaA8ChGcMwE&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 4. [**Activation Functions:** ReLU, GELU, SwiGLU](https://www.youtube.com/watch?v=G5gkYVB-P-Q&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 5. [**GPU Coding:** PyTorch, torch.compile(), fused kernels, CUDA, Triton](https://www.youtube.com/watch?v=VVk6N1_rFD0&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 6. [**MLPs/FFNs**: Multi-input, Multi-Layer Perceptrons, Feed-Forward Networks](https://www.youtube.com/watch?v=6BU9Gj2yoSw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 7. [**Loss Functions**: Residual errors, RMSE, Cross Entropy, Loss Landscapes](https://www.youtube.com/watch?v=bVz8i9EWEQw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 8. [**Backpropagation**: Training loops, Optimizers, Learning Rate, Batch Size](https://www.youtube.com/watch?v=Zf6RC6KZxKg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 9. [**Saving & Loading** Models](https://www.youtube.com/watch?v=riCiHjVEqXc&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 10. [**Initialization**: Kaiming, Glorot](https://www.youtube.com/watch?v=-pwr0RMhCg8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 11. [**Residuals**: Addition, Scaling, Gated, Concatenation](https://www.youtube.com/watch?v=e5V7QaHq5lQ&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 12. [**Normalization**: Pre-norm vs. Post-norm, RMSNorm, BatchNorm, LayerNorm](https://www.youtube.com/watch?v=ZqSbev8Y-ys&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 13. [**Regularization**: Dropout, Gradient Clipping, Weight Decay](https://www.youtube.com/watch?v=2O8v8BX1LgM&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 14. [**SoftMax**](https://www.youtube.com/watch?v=H2yV3jd4DKg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 15. [**Tokenizers**: By Character, By Word, BPE, SentencePiece](https://www.youtube.com/watch?v=TPPhTqPu_Yg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 16. [**Embeddings**: Absolute vs. Learned, Sinusoidal vs. RoPE](https://www.youtube.com/watch?v=jyrgYjeVHBo&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 17. [**Attention**: MHA, GQA, MQA, MLA](https://www.youtube.com/watch?v=CvGf-Eu2sl0&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 18. [**Transformers**](https://www.youtube.com/watch?v=mKAW7cYYwQs&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 19. [**Pre-training**: Data Sources, Datasets, HTML Cleaning, Quality Filtering, Sharding ](https://www.youtube.com/watch?v=nN335-483Pg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 20. [**Evaluation**: Leaderboards, Benchmarks, Verifiers vs LLM-as-Judge ](https://www.youtube.com/watch?v=S6uLzsqOOUc&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 21. [**Instruction Tuning:** Alpaca & Other Formats, Self Instruct, Capabilities](https://www.youtube.com/watch?v=8iwxM6XRpVQ&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 22. [**Reinforcement Learning:** Policy Optimization, SimPO](https://www.youtube.com/watch?v=3DJGUp0CVx8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 23. [What We Didn't Cover: Scaling ](https://www.youtube.com/watch?v=YdOsmHDeeLw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) Each section has slides teaching the concepts, followed by excel-by-hand developing intuition for the math, and then coding examples. The goal is able to grok all parts of modern LLM development. We did this workshop [in-person in San Francisco](https://emilyhk.com/llm-workshop/) last month and hopefully the spaciousness of watching online works for everyone. If don't like watching videos, you can get the [slides and exercises](https://go.JustinAngel.ai/deck) and work self-paced.
查看缓存全文
缓存时间: 2026/06/05 05:09
# TL;DR 摘要
本工作坊教你从零构建自己的大语言模型(LLM),无需数学或机器学习先修知识,只需熟悉编程。通过直观的直觉培养、Excel手动演示和Python/PyTorch代码实践,你将理解Transformer架构、训练流程,并最终拥有一个可运行的小型LLM。
## 为什么我们要构建自己的大语言模型?
你花数小时参与这个深度技术工作坊,能得到什么?核心答案是:**培养对AI和机器学习模型如何构建的品味与直觉**。你会明白:
- 这些模型背后没有任何魔法,一切都是数学和反向传播。
- 你会了解模型的局限性——如果你在其上构建应用或智能体,这至关重要。
- 你将能编写所有机器学习代码和LLM架构代码,知道如何进行预训练和后训练。
- 你能读懂开源模型(如nano chat等)的代码,提升在AI/ML解决方案工作中的可迁移技能。
- 当DeepSeek发布模型导致股市波动时,你就能理解稀疏注意力与密集注意力意味着什么。
工作坊虽不能直接让你被前沿实验室录用,但它提供了获得这些职位所需的一切基础:GPU编程、AI安全等子领域都离不开这些知识。
## 先决条件与非先决条件
**要求**:软件工程师、熟悉编码、能花8小时阅读代码和学习新概念。
**非要求**:
- 数学:线性代数、微积分、统计学等不是必须——我们会在一天内教你直觉,而不是证明。
- Python:会用更好,但我们会将Python使用降到最低,采用跨语言惯用写法,且2026年可用AI辅助读写代码。
- 机器学习:不需要事先了解感知机、神经元——所有概念都会涵盖。
## 关于讲师 Justin Angel
23年软件工程师经验,曾在Meta、Uber、Amazon、Apple、Microsoft工作,担任过IC8(Meta董事级别IC)。2023-2024年所有代码均由AI编写,坚信“任何不能从本质上理解AI的软件工程师很快将无法就业”。近期获得AI/ML硕士学位,论文主题为LLM心理治疗。强调自己不是20年经验的ML工程师,但能提供实用视角。
## 学习方法论:手动AI + 代码实践
工作坊分为约23个部分,每个部分由三阶段组成:
1. **概念讲解**:讲师用幻灯片解释要解决的问题、技术如何融入大局,培养直觉。
2. **手动AI**:在Excel(Google Sheets)中手动操作矩阵乘法、移动数字,从数学角度建立直觉。此方法感谢科罗拉多大学博尔德分校的Tom Yey教授。
3. **代码审查**:每个部分附有Python/PyTorch笔记本,基于幻灯片和Excel内容实现代码。讲师逐部分引导。
**你的责任**:
- 填写Excel中不带答案的版本。
- 运行、调整、阅读Colab笔记本。
- 完成每部分1-3个练习(约15-20分钟),并理解答案。
## 工作坊日程安排
### 引言部分:使用现有GPT-2风格Transformer
拿一个现成的GPT-2风格Transformer并运行它,了解自回归循环等概念,构建全天完整路线图。
### 机器学习基础:从单一神经元开始
- 什么是神经元?
- 如何训练一个网络?
- 什么是损失函数?
- 如何使用梯度下降?
交付成果:一个训练好的深度神经网络(非语言模型),所有概念100%可转移到大语言模型。
### Transformer架构:逐一学习组件并组合
- 多层感知机(MLP)
- Dropout组件
- 分词器
- 嵌入层
- 注意力机制
最终将所有组件串接成大的Transformer架构。
### 大语言模型交付:预训练与后训练
编写后训练、预训练脚本,在一天结束时拥有自己的、可工作的大语言模型,打上你自己的名字和版本号V1。
## 工作坊资源链接
所有资源遵循简单命名约定:
- 演示文稿:`go.justinangel.ai/deck`
- 代码笔记本:`go.justinangel.ai/code-{部分编号}`
- Excel电子表格:`go.justinangel.ai/excel-{部分编号}`
- 主链接(包含所有链接):`go.justinangel.ai/drive`
## 立即启动训练:第零部分
因为训练一个大语言模型需要8-20小时,我们工作坊一开始就需要启动训练。访问 `go.justinangel.ai/code-zero`,连接A100 GPU(需Google Colab Pro Plus),点击“全部运行”,模型将在后台运行20+小时。这样,到工作坊结束时,你将拥有自己模型!
---
**Source**: [Hi Reddit, I posted my Build Your Own LLM workshop to Youtube (GPT2 & Qwen3.6 style)](https://www.youtube.com/watch?v=vXiB0UdDhk8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6&index=1)
相似文章
@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …
LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。
@yibie: 推荐这个 repo,从零构建 GPT 风格 transformer,不用任何高级库。13M 参数就能产出语法正确的文本,在免费 Colab 的 T4 上一天就能训完。 从零训练自己的 LLM:13M 参数的 GPT 实现 Akshay 分…
推荐了一个从零构建GPT风格Transformer的GitHub仓库,无需高级库,13M参数即可在免费Colab上训练一天,生成语法正确的文本。
@GitHub_Daily: 想搞懂大语言模型底层原理,大部分资料只介绍理论知识,或者只给源码,看完还是一头雾水。 偶然看到 EveryonesLLM 这个开源教程,手把手带我们在 Google Colab 上从零搭建一个完整的大语言模型,全程动手写代码。 整套教程分…
EveryonesLLM 是一个开源教程,提供29个章节的Colab笔记本,手把手教用户从零在Google Colab上搭建完整的大语言模型,包括预训练和指令微调,并支持中文。
@JustinAngel: https://x.com/JustinAngel/status/2069482255312195980
发布免费的研讨会录像和材料(23个视频、250张幻灯片、50个练习),帮助你从基础知识到Transformer架构构建自己的大语言模型,无需数学或机器学习基础。
@Jasper_Wei1: https://x.com/Jasper_Wei1/status/2077415262094229762
这篇手把手教程详细介绍了如何使用OpenAI的GPT-Live进行英语口语练习,包括测试水平、场景练习和复盘步骤,提供了可直接复制的提示词。