@Krishna70284154:从头训练一个LLM的单个项目为我做了两件事:- 它让我从大多数候选人中脱颖而出 - 它……
摘要
一条推文分享了从头训练一个LLM如何帮助作者在AI面试中脱颖而出,并且自信地回答关于Transformer、微调和RAG的问题。
一个单独的项目
从头训练一个LLM
为我做了两件事:
- 让我从大多数候选人中脱颖而出
- 让我几乎能自信地回答所有关于Transformer、LLM和微调的问题
- 也让我更精确地回答基于RAG的问题
大多数AI/ML面试官都会问很多关于LLM的问题
仅仅阅读或观看视频帮助不大
动手实现并亲自实践会让你更有价值
可以关注@karpathy的nanochat,或者@rasbt的build a LLM,或者CS336来完成这个
查看缓存全文
缓存时间: 2026/07/11 21:29
一个单独的项目
从头开始训练一个LLM
让我有了两方面的收获:
- 它让我在众多候选人中脱颖而出
- 它让我能自信地回答几乎所有关于Transformer、LLM和微调的问题
- 同时也让我更精准地回答基于RAG的问题
大多数AI/ML面试官都会问很多关于LLM的问题
光是阅读或观看视频帮助不大
动手实现、亲自动手操作才能真正让你变得有价值
可以关注 @karpathy 的 nanochat 或 @rasbt 的 build a LLM,或者 CS336 来实现这一点
相似文章
@akshay_pachaar: Andrej Karpathy 将LLM训练的整个历史总结为三个名词:- 文本 - 对话 - 及环境…
Andrej Karpathy将LLM训练概括为文本、对话和环境;Prime Intellect的Verifiers是一个开源框架,用于构建和共享LLM的强化学习环境,采用MIT许可证发布,附带一个包含2500多个环境的中枢。
@_rohit_tiwari_: 这本230页的书揭示了LLM的秘密。https://drive.google.com/file/d/1ZqV0wByb65_wvzWUbaLw6pCbtXgyXDHG/view……
一本230页的书,全面涵盖LLM概念,包括预训练、微调、对齐和提示技术。
@MLWhiz:我花了两个多月的时间撰写GenAI Fundamentals系列——这是我试图建立关于“LLMs如何运作”的思维模型…
拉胡尔(MLWhiz)撰写的综合博客系列从零开始构建对LLMs的理解,涵盖transformer、预训练和后训练五个部分。
@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…
这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。
@RohOnChain: 刚刚与一位正在构建下一代前沿大语言模型的MIT计算机科学毕业生交谈。他告诉我这场由OpenAI研究员关于……的讲座
一条推文推荐了OpenAI研究员关于大语言模型构建方法的讲座,声称这场讲座教给一位MIT计算机科学毕业生的知识比他的整个学位还多。