从零开始在8GB显存上训练LLM。我开心
摘要
构建了一个仓库,用于在8GB显存上从零训练一个微型语言模型(25M参数),支持MTP,但指出mHC和BitNet的局限性。
我昨天发了个帖子:[https://www.reddit.com/r/LocalLLaMA/comments/1tqjuzg/why\_is\_there\_no\_community\_project\_for\_training/](https://www.reddit.com/r/LocalLLaMA/comments/1tqjuzg/why_is_there_no_community_project_for_training/) 我今天写了个程序:[https://github.com/epoyraz/train-a-model-from-scratch](https://github.com/epoyraz/train-a-model-from-scratch) 亮点:\- 用8GB显存从零训练tinystories。耶 \- mHC不好(模型太小) \- BitNet太慢(训练时没有内存增益) \- TurboQuant(不需要) \- MTP可行。耶耶耶(但让训练变慢) 嗯……这不是LLM,是个25M的小模型:[https://huggingface.co/epoyraz/tinystories-25m](https://huggingface.co/epoyraz/tinystories-25m)
相似文章
本地LLM CPU用户……你们做任何事情要花多长时间?
关于在CPU上本地运行大语言模型性能的讨论,特别是大上下文尺寸的情况,以及显存限制带来的挑战。
我从头开发了自己的量化大语言模型,使用300亿个token进行训练,部署大小仅为60 MB [R]
一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。
@bytebytego: 如何在本地运行LLMs
一份指南,说明如何在您自己的硬件上本地运行大型语言模型。
@heygurisingh: 过去训练参数量达数十亿的LLM需要花费1000万美元以上。有人开源了一个仓库,现在可以在单张GPU上完成。
一个名为train-llm-from-scratch的开源仓库使得在单张GPU上训练十亿级参数的LLM成为可能,它提供了一个从原始文本到推理的可配置流水线,包括数据集流式加载和检查点保存,采用MIT许可证。
基于1800年代文本从头训练LLM(160GB数据集)
作者详细介绍了使用160GB的1800年代英语文本从头训练LLM的过程,训练了一个5亿参数的评估模型,并计划训练一个20亿参数的模型,结果显示在历史问答方面有不错的前景。