@AYi_AInotes: 学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现…
摘要
两名19岁滑铁卢大学本科生在四个月内从零构建了完整的机器学习框架和1200万参数的大语言模型,使用Rust和TypeScript,强调从底层理解而非单纯调包。
查看缓存全文
缓存时间: 2026/05/16 07:12
学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单
看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。
两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。
说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。
这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。
还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。
Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。
真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。
大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ
而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈
这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。
当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。
它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。
我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。
最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。
想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了
Aadi Kulshrestha (@MankyDankyBanky): I trained a 12M parameter LLM on my own ML framework using a Rust backend and CUDA kernels for flash attention, AdamW, and more.
Wrote the full transformer architecture, and BPE tokenizer from scratch.
The framework features:
- Custom CUDA kernels (Flash Attention, fused
相似文章
@NFTCPS: 兄弟们,搞AI不搞大模型,等于白干! 今天必须给你们安利一本开源神书《大模型基础》,别等了,看它就够了! 这书不跟你整那些虚的,一招打透!从大语言模型入门到架构演化,再一口气给你拆解Prompt工程、参数高效微调、模型编辑、RAG(检索增…
该文章推广了开源书籍《大模型基础》,系统讲解大语言模型相关知识,并介绍了多智能体开发框架Agent-Kernel。
@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …
LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。
@NFTCPS: 天天喊着搞AI,结果你连Transformer是个啥都说不清? 有个仓库够狠,从零手搓一个GPT,不调任何高级库。Attention、多头、前馈、Embedding、残差、Layer Norm,怎么拼起来的全摊给你看。而且不止模型,整条链…
一个GitHub开源项目,从零实现完整的GPT训练流程,包含数据预处理、预训练、SFT和RLHF后训练,全部基于原生PyTorch,适合想深入理解Transformer原理的开发者。
@tanzhengmc97: https://x.com/tanzhengmc97/status/2066531753762656730
用通俗易懂的语言解释了大模型的运行原理,包括词向量、Transformer注意力机制、下一个词预测训练以及涌现能力,适合初学者理解AI基础概念。
@XAMTO_AI: 别再收藏那些看着热闹、用不上的 AI 教程了。 这本 《动手学大模型》 才是真正需要的——开源、免费、代码能跑。 全书 12 章,手把手带你走完大模型落地的完整流程: ① 语言模型基础 ② 提示词工程 ③ 语义搜索 ④ 模型微调 ⑤ 多模…
推荐一本开源免费的《动手学大模型》教程,涵盖语言模型基础、提示词工程、语义搜索、模型微调、多模态应用等12章,所有代码可直接在Colab中运行。