@heygurisingh: 过去训练参数量达数十亿的LLM需要花费1000万美元以上。有人开源了一个仓库,现在可以在单张GPU上完成。
摘要
一个名为train-llm-from-scratch的开源仓库使得在单张GPU上训练十亿级参数的LLM成为可能,它提供了一个从原始文本到推理的可配置流水线,包括数据集流式加载和检查点保存,采用MIT许可证。
查看缓存全文
缓存时间: 2026/05/20 10:29
十亿参数的大语言模型曾经需要花费超过1000万美元来训练。
有人开源了一个能在单张GPU上完成训练的仓库。
它叫做 train-llm-from-scratch。整个流程整合在一个仓库中,从原始文本到可运行的语言模型,每一步都有详细指导。
它的独特之处在于可扩展的架构。你只需更改一个配置文件,同一份代码就能训练从1300万参数的玩具模型到10亿参数的大模型。
→ 预训练流程:涵盖数据集准备、分词和训练循环 → 可配置的模型规模:从百万到数十亿参数 → 通过梯度累积和混合精度,在单张GPU上运行 → 纯PyTorch实现,无黑盒封装 → 包含推理脚本,让你能实际使用训练好的模型
你实际获得的内容:
→ 逐步代码,与OpenAI和Anthropic训练基础模型的方式一致 → 数据集流式处理,无需本地存储数TB数据 → 内置检查点机制,崩溃不会毁掉40小时的训练 → 详细的README,解释每项架构选择 → 兼容你提供的任何文本语料
最令人惊讶的是成本计算。过去需要数据中心和数百万算力的工作,现在可以在你机器上的GPU中运行。
大多数人仍在为使用模型支付API费用,而这些模型他们本可以自己训练。
MIT许可证。100%开源。
相似文章
@oliviscusAI:OpenAI 联合创始人刚刚发布了他的个人指南,教你从头训练大语言模型。它叫 llm.c。无需繁琐设置。只…
OpenAI 联合创始人 Andrej Karpathy 发布了 llm.c,这是一份开源指南,教你如何从头训练大语言模型。代码简洁,可在任何硬件上运行,包括 CPU 和 MacBook,并且比标准方法快 7%。
@tom_doerr: 在单个 GPU 上从头训练十亿参数的大语言模型 https://github.com/FareedKhan-dev/train-llm-from-scratch…
一个 GitHub 仓库提供了基于 Transformer 架构、使用 PyTorch 在单个 GPU 上从头训练十亿参数语言模型的脚本。
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。
@akshay_pachaar: 从头开始训练你自己的LLM。这个仓库从头构建了一个GPT风格的Transformer,完全不用高级库…
一个从零开始构建GPT风格Transformer的仓库,不使用高级库,涵盖了从数据预处理到生成的整个过程,并包括SFT和RLHF的指南。
大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]
一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。