Hi Reddit, I posted my Build Your Own LLM workshop to Youtube (GPT2 & Qwen3.6 style)

Reddit r/LocalLLaMA 工具

摘要

Justin Angel 发布了一个完整的 YouTube 工作坊,教你从零构建自己的大语言模型(基于 GPT-2 和 Qwen3.6 风格),涵盖 Transformer 架构、训练流程,并提供 Excel 手动操作和 Python/PyTorch 代码实践,无需数学或 ML 先修知识。

Hi internet friends, I recorded a workshop about building your own LLM without any math / ML prerequisites. It covers everything from machine learning fundamentals, deep neural networks, transformer architecture, and pre/post-training. The only prerequisite is being comfortable with learning through code & excel examples. 1. [**Sampling** Large Language Models](https://www.youtube.com/watch?v=vXiB0UdDhk8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 2. [**Reverse Engineering** Large Language Model](https://www.youtube.com/watch?v=E0rkgxwhz5g&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 3. [**Perceptrons:** wx+b](https://www.youtube.com/watch?v=uaA8ChGcMwE&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 4. [**Activation Functions:** ReLU, GELU, SwiGLU](https://www.youtube.com/watch?v=G5gkYVB-P-Q&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 5. [**GPU Coding:** PyTorch, torch.compile(), fused kernels, CUDA, Triton](https://www.youtube.com/watch?v=VVk6N1_rFD0&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 6. [**MLPs/FFNs**: Multi-input, Multi-Layer Perceptrons, Feed-Forward Networks](https://www.youtube.com/watch?v=6BU9Gj2yoSw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 7. [**Loss Functions**: Residual errors, RMSE, Cross Entropy, Loss Landscapes](https://www.youtube.com/watch?v=bVz8i9EWEQw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 8. [**Backpropagation**: Training loops, Optimizers, Learning Rate, Batch Size](https://www.youtube.com/watch?v=Zf6RC6KZxKg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 9. [**Saving & Loading** Models](https://www.youtube.com/watch?v=riCiHjVEqXc&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 10. [**Initialization**: Kaiming, Glorot](https://www.youtube.com/watch?v=-pwr0RMhCg8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 11. [**Residuals**: Addition, Scaling, Gated, Concatenation](https://www.youtube.com/watch?v=e5V7QaHq5lQ&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 12. [**Normalization**: Pre-norm vs. Post-norm, RMSNorm, BatchNorm, LayerNorm](https://www.youtube.com/watch?v=ZqSbev8Y-ys&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 13. [**Regularization**: Dropout, Gradient Clipping, Weight Decay](https://www.youtube.com/watch?v=2O8v8BX1LgM&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 14. [**SoftMax**](https://www.youtube.com/watch?v=H2yV3jd4DKg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 15. [**Tokenizers**: By Character, By Word, BPE, SentencePiece](https://www.youtube.com/watch?v=TPPhTqPu_Yg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 16. [**Embeddings**: Absolute vs. Learned, Sinusoidal vs. RoPE](https://www.youtube.com/watch?v=jyrgYjeVHBo&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 17. [**Attention**: MHA, GQA, MQA, MLA](https://www.youtube.com/watch?v=CvGf-Eu2sl0&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 18. [**Transformers**](https://www.youtube.com/watch?v=mKAW7cYYwQs&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 19. [**Pre-training**: Data Sources, Datasets, HTML Cleaning, Quality Filtering, Sharding ](https://www.youtube.com/watch?v=nN335-483Pg&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 20. [**Evaluation**: Leaderboards, Benchmarks, Verifiers vs LLM-as-Judge ](https://www.youtube.com/watch?v=S6uLzsqOOUc&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 21. [**Instruction Tuning:** Alpaca & Other Formats, Self Instruct, Capabilities](https://www.youtube.com/watch?v=8iwxM6XRpVQ&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 22. [**Reinforcement Learning:** Policy Optimization, SimPO](https://www.youtube.com/watch?v=3DJGUp0CVx8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) 23. [What We Didn't Cover: Scaling ](https://www.youtube.com/watch?v=YdOsmHDeeLw&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6) Each section has slides teaching the concepts, followed by excel-by-hand developing intuition for the math, and then coding examples. The goal is able to grok all parts of modern LLM development. We did this workshop [in-person in San Francisco](https://emilyhk.com/llm-workshop/) last month and hopefully the spaciousness of watching online works for everyone. If don't like watching videos, you can get the [slides and exercises](https://go.JustinAngel.ai/deck) and work self-paced.
查看原文
查看缓存全文

缓存时间: 2026/06/05 05:09

# TL;DR 摘要 本工作坊教你从零构建自己的大语言模型(LLM),无需数学或机器学习先修知识,只需熟悉编程。通过直观的直觉培养、Excel手动演示和Python/PyTorch代码实践,你将理解Transformer架构、训练流程,并最终拥有一个可运行的小型LLM。 ## 为什么我们要构建自己的大语言模型? 你花数小时参与这个深度技术工作坊,能得到什么?核心答案是:**培养对AI和机器学习模型如何构建的品味与直觉**。你会明白: - 这些模型背后没有任何魔法,一切都是数学和反向传播。 - 你会了解模型的局限性——如果你在其上构建应用或智能体,这至关重要。 - 你将能编写所有机器学习代码和LLM架构代码,知道如何进行预训练和后训练。 - 你能读懂开源模型(如nano chat等)的代码,提升在AI/ML解决方案工作中的可迁移技能。 - 当DeepSeek发布模型导致股市波动时,你就能理解稀疏注意力与密集注意力意味着什么。 工作坊虽不能直接让你被前沿实验室录用,但它提供了获得这些职位所需的一切基础:GPU编程、AI安全等子领域都离不开这些知识。 ## 先决条件与非先决条件 **要求**:软件工程师、熟悉编码、能花8小时阅读代码和学习新概念。 **非要求**: - 数学:线性代数、微积分、统计学等不是必须——我们会在一天内教你直觉,而不是证明。 - Python:会用更好,但我们会将Python使用降到最低,采用跨语言惯用写法,且2026年可用AI辅助读写代码。 - 机器学习:不需要事先了解感知机、神经元——所有概念都会涵盖。 ## 关于讲师 Justin Angel 23年软件工程师经验,曾在Meta、Uber、Amazon、Apple、Microsoft工作,担任过IC8(Meta董事级别IC)。2023-2024年所有代码均由AI编写,坚信“任何不能从本质上理解AI的软件工程师很快将无法就业”。近期获得AI/ML硕士学位,论文主题为LLM心理治疗。强调自己不是20年经验的ML工程师,但能提供实用视角。 ## 学习方法论:手动AI + 代码实践 工作坊分为约23个部分,每个部分由三阶段组成: 1. **概念讲解**:讲师用幻灯片解释要解决的问题、技术如何融入大局,培养直觉。 2. **手动AI**:在Excel(Google Sheets)中手动操作矩阵乘法、移动数字,从数学角度建立直觉。此方法感谢科罗拉多大学博尔德分校的Tom Yey教授。 3. **代码审查**:每个部分附有Python/PyTorch笔记本,基于幻灯片和Excel内容实现代码。讲师逐部分引导。 **你的责任**: - 填写Excel中不带答案的版本。 - 运行、调整、阅读Colab笔记本。 - 完成每部分1-3个练习(约15-20分钟),并理解答案。 ## 工作坊日程安排 ### 引言部分:使用现有GPT-2风格Transformer 拿一个现成的GPT-2风格Transformer并运行它,了解自回归循环等概念,构建全天完整路线图。 ### 机器学习基础:从单一神经元开始 - 什么是神经元? - 如何训练一个网络? - 什么是损失函数? - 如何使用梯度下降? 交付成果:一个训练好的深度神经网络(非语言模型),所有概念100%可转移到大语言模型。 ### Transformer架构:逐一学习组件并组合 - 多层感知机(MLP) - Dropout组件 - 分词器 - 嵌入层 - 注意力机制 最终将所有组件串接成大的Transformer架构。 ### 大语言模型交付:预训练与后训练 编写后训练、预训练脚本,在一天结束时拥有自己的、可工作的大语言模型,打上你自己的名字和版本号V1。 ## 工作坊资源链接 所有资源遵循简单命名约定: - 演示文稿:`go.justinangel.ai/deck` - 代码笔记本:`go.justinangel.ai/code-{部分编号}` - Excel电子表格:`go.justinangel.ai/excel-{部分编号}` - 主链接(包含所有链接):`go.justinangel.ai/drive` ## 立即启动训练:第零部分 因为训练一个大语言模型需要8-20小时,我们工作坊一开始就需要启动训练。访问 `go.justinangel.ai/code-zero`,连接A100 GPU(需Google Colab Pro Plus),点击“全部运行”,模型将在后台运行20+小时。这样,到工作坊结束时,你将拥有自己模型! --- **Source**: [Hi Reddit, I posted my Build Your Own LLM workshop to Youtube (GPT2 & Qwen3.6 style)](https://www.youtube.com/watch?v=vXiB0UdDhk8&list=PLweJS2YZCfkeXXdfCKGaxAhm2w8p0u1z6&index=1)

相似文章

@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …

X AI KOLs Timeline

LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。

@GitHub_Daily: 想搞懂大语言模型底层原理,大部分资料只介绍理论知识,或者只给源码,看完还是一头雾水。 偶然看到 EveryonesLLM 这个开源教程,手把手带我们在 Google Colab 上从零搭建一个完整的大语言模型,全程动手写代码。 整套教程分…

X AI KOLs Timeline

EveryonesLLM 是一个开源教程,提供29个章节的Colab笔记本,手把手教用户从零在Google Colab上搭建完整的大语言模型,包括预训练和指令微调,并支持中文。