@Mechramc: 我写了934页,从头构建大型语言模型的每一层。其中许多概念对我来说也是一年前才接触到的...

X AI KOLs Timeline 产品

摘要

Ramchand Kumaresan 出版了一本934页的书籍,教授如何从头构建LLM的每一层,包含35个动手项目和一个配套代码库。

我写了934页,从头构建大型语言模型的每一层。其中许多概念对我来说也是一年前才接触到的。 分词器、注意力机制、KV缓存、混合专家模型、RLHF、量化、服务化。35个项目。每一章都有一个部分让你拆解刚刚构建的内容。 我用于构建 TamilLM 的所有内容都在本书中。如果你一直在关注这个旅程,并想了解底层实际发生了什么,从这里开始。本书各章还关联到我之前的论文。 目前已售出35本。 https://leanpub.com/under-the-hood 开始吧。
查看原文
查看缓存全文

缓存时间: 2026/07/11 07:21

我写了934页,详细讲解如何从零构建大语言模型的每一层。一年前,这些概念中有许多对我来说还是全新的。

分词器、注意力机制、KV Cache、MoE、RLHF、量化、模型服务。35个项目。每一章都有一个让你破坏自己刚构建内容的环节。

我构建TamilLM所用的全部知识都在本书中。如果你一直关注这段旅程,想了解引擎盖下到底发生了什么,就从这里开始。书中各章节也与我之前发表的论文紧密相连。

目前已售出35本。

https://leanpub.com/under-the-hood

让我们开始吧。


Under The Hood

来源: https://leanpub.com/under-the-hood 从零构建大语言模型的每一层

你付费

作者收益

关于本书

大多数大语言模型书籍教你使用模型。这本书教你构建模型——每一层、每一步优化器、每一个缓存、每一种量化方案——然后刻意破坏每个组件,让你理解它为什么存在。

这是一本以工作坊形式写成的书。35个动手项目,约25万字,一条紧凑的螺旋主线,带你从单个自动求导标量一直走到将独立训练的专家模型融合为路由系统。没有黑箱。没有“导入库,调用方法”。你写代码,你运行,你破坏,你测量破坏了什么。

每个项目都遵循同样严谨的节奏:钩子 → 概念 → 为何重要 → 构建 → 破坏它 → 可选作业 → 需要回答的问题 → 进一步探索 → 你现在知道什么。不破坏代码而阅读这本书只体验了一半。真正的教训就藏在破坏环节中。

配套公开代码仓库位于 github.com/mechramc/Under-the-hood,包含每个项目可运行的 build.py、测试文件和输出示例。

如果你曾经读过Transformer论文,感觉图表和代码属于两个不同的世界——这本书会弥合这个差距。

构建它。破坏它。测量它。

分享本书

分类

反馈

分期付款进度

1/3

作者

Ramchand Kumaresan (https://leanpub.com/u/mechramc)

Ramchand Kumaresan是Procore Technologies的高级项目经理,也是Murai Labs的创始人——一个单人AI研究实验室,建立在“严谨的工程比炒作更重要”这一理念之上。

他发表的作品包括KALAVAI(用于跨专家适配器路由的协作式LoRA融合)、UYIR(LoRA适配器的进化生命周期,目前正在TMLR审稿中),以及Orion(第一个开放式端到端系统,用于对Apple Neural Engine进行大语言模型推理和训练的编程)。他目前的研究重点是可遗传的稀疏突变掩码(MARMAM),扎根于泰米尔悉达marmam穴位疗法。

他写Under the Hood是为了教会他自己不知道的东西——然后随着学习不断深入继续写下去。这本书就是他在沿途留下的轨迹。

发布

在YouTube上订阅 (https://www.youtube.com/@Leanpub?sub_confirmation=1)

短视频

  • 17年项目管理与AI | 真实故事 (https://www.youtube.com/shorts/o4zJ0azPomE)
  • 40岁学AI | 掌握语言模型是否已太晚 (https://www.youtube.com/shorts/0c3Nta3DuDc)
  • AI无声崩溃 | 理解语言模型的关键 (https://www.youtube.com/shorts/7SsdDnRifjY)
  • AI研究 | 让未来变得乏味、可靠和真实 (https://www.youtube.com/watch?v=https://youtube.com/shorts/g0BC12HOjvw)
  • 破坏AI系统 | 节省数百万实验费用! (https://www.youtube.com/shorts/RyzcxLdn0EY)

查看所有短视频→ (https://leanpub.com/clips)

目录

Under The Hood

  1. 大语言模型工程手册

版权

前言:这本书到底要你做什么

使用代码仓库

  1. 仓库的组织方式
  2. 每章的预期工作流程
  3. 运行代码
  4. 这个仓库不是什么
  5. 问题报告

预备知识:Python、张量以及语言模型到底是什么

  1. 语言模型到底是什么
  2. 模型如何学习:三个步骤
  3. 阅读本书需要的Python知识
  4. 数字作为张量
  5. 本书的结构
  6. 快速参考:卡住了怎么办
  7. 你现在知道什么

项目1:学习机器

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目2:预测下一个字符

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 构建神经字符模型
  6. 破坏它
  7. 可选作业
  8. 需要回答的问题
  9. 进一步探索
  10. 你现在知道什么
  11. 起点

项目3:构建分词器

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目4:从头实现注意力机制

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目5:从空白文件开始你的GPT

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目6:从原型到nanoGPT

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目7:重要的细节

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目8:Flash Attention与分块内核

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目9:在真实网络上预训练

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目10:数据整理与污染

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目11:训练调试:尖峰、NaN与分析

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目12:分布式训练:FSDP与ZeRO(单机代理)

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目13:快速推理:KV Cache

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目14:投机解码

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目15:分组查询注意力

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目16:长上下文扩展(RoPE、YaRN、NTK-Aware)

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目17:生产级服务:连续批处理与PagedAttention

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目18:混合专家模型

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目19:缩放定律

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目20:自动实验

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目21:微调与指令微调

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目22:评估方法

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目23:奖励模型与RLHF

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目24:DPO与偏好优化

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目25:测试时推理(CoT、自一致性、Best-of-N)

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目26:工具使用与函数调用

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目27:量化与部署

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目28:检索增强生成

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目29:多模态:一个微型视觉-语言模型

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目30:非Transformer架构(Mamba、RWKV)

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目31:层冻结与迁移

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目32:融合独立训练的专家模型

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 起点

项目33:接口规范

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 研究锚点
  11. 起点

项目34:增量组装

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 你现在知道什么
  10. 研究锚点
  11. 起点

项目35:你的架构

  1. 钩子
  2. 概念
  3. 为何重要
  4. 构建
  5. 破坏它
  6. 可选作业
  7. 需要回答的问题
  8. 进一步探索
  9. 研究锚点
  10. 你现在知道什么
  11. 领域现状
  12. 如何应对高要求面试
  13. 前沿阅读路线图
  14. 本书现在赋予你的能力
  15. 起点

附录A:讲座配套材料

  1. 如何使用本附录
  2. 预备知识配套:Python与张量基础
  3. 第一部分配套:学习机制、分词、注意力
  4. 第二部分配套:构建与训练Transformer
  5. 第三部分配套:推理、效率与缩放
  6. 第四部分配套:后训练、对齐、部署
  7. 第五部分配套:迁移、模块化、接口、研究
  8. 建议的学习节奏

附录B:免费资源

  1. 按主题分类的参考架构
  2. 稳定性规则

附录C:注释、来源与参考书目

  1. 项目来源

词汇表

Leanpub 60天100%满意度保证

购买后60天内,你只需点击两次即可获得100%退款

查看完整条款… (https://leanpub.com/refunds)

10美元消费赚8美元,20美元消费赚16美元

对于7.99美元或以上的购买,我们支付80%版税;对于0.99美元至7.98美元的购买,我们支付80%版税减去50美分固定费用你在10美元销售中赚8美元,在20美元销售中赚16美元。所以,如果我们以20美元价格售出5000本未退款的书,你将赚取80,000美元

(是的,有些作者在Leanpub上赚得远不止这些。)

事实上,作者们已经通过Write Duo在Leanpub上赚取了超过1500万美元 (https://leanpub.com/authors) 。

了解更多关于在Leanpub上写作的信息 (https://leanpub.com/authors)

免费更新。无DRM。

如果你购买了一本Leanpub书籍,只要作者更新该书,你就可以免费获得更新!许多作者使用Leanpub以进行中形式出版他们的书籍,边写边出版。所有读者都能获得免费更新,无论他们何时购买或支付了多少(包括免费)。

大多数Leanpub书籍提供PDF(用于电脑)和EPUB(用于手机、平板和Kindle)格式。本书包含的格式显示在本页面右上角。

最后,Leanpub书籍没有任何DRM复制保护废话,因此你可以在任何支持的设备上轻松阅读。

了解更多关于Leanpub电子书格式以及在哪里阅读它们的信息 (https://help.leanpub.com/reader-help/what-formats-do-leanpub-books-come-in)

在Leanpub上写作与出版

你可以利用Leanpub轻松写作、出版和销售进行中及已完成电子书和在线课程!

Leanpub是一个面向严肃作者的强大平台,将简单、优雅的写作与出版工作流程,与专注于销售进行中电子书的商店结合在一起。

Leanpub对于作者来说就像一台神奇的打字机:只需用纯文本写作,要出版你的电子书,只需点击一个按钮。(或者,如果你自己制作电子书,你甚至可以上传自己的PDF和/或EPUB文件,然后一键发布!)就这么简单。

了解更多关于在Leanpub上写作的信息 (https://leanpub.com/authors)

相似文章

@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …

X AI KOLs Timeline

LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。

rasbt/LLMs-from-scratch

GitHub Trending (daily)

该仓库提供开源代码,用于从零开始构建、预训练和微调一个类似GPT的大型语言模型,是Sebastian Raschka同名书籍的官方代码配套。