与其搞去中心化训练,不如构建“统一数据集”
摘要
一个论点:开源社区不应专注于去中心化训练LLM,而应协作创建一个大型、高质量、类似BitTorrent那样可在人们计算机上获取的预训练数据集。
这里有很多帖子呼吁联合训练一个新的开放模型LLM。主要原因是在政府禁止商业前沿模型的噱头之后,以及最近缺乏中小型开源权重模型的发布。我真的相信在某个时候我们会拥有“SETI for LLM”。但不会很快,不是今年。它需要对高延迟网络上的训练算法进行严肃的基础研究。我认为更有价值的是为未来的这种训练运行准备预训练数据。这远非“超级困难”的任务。可以发明类似于BitTorrent下载器的客户端(氛围工程),用于从互联网抓取、清理和托管(共享)数据。一个拥有数万亿高质量token的全球新数据库,公开可用,托管在人们的计算机上,将是开源社区向那些窃取我们数据和VRAM的亿万富翁们传递的真正信息。我们不要梦想在家用GPU上进行分布式LLM训练。我们应该专注于更实际的事情。仅仅是这样一个数据集的存在,就会自行加速分布式训练的发展。
相似文章
LocalLLaMA 众包编程数据集
一位社区成员提议为本地大语言模型创建一个众包编程数据集,以实现协作模型训练和微调,并回应了关于未来开源权重模型可用性的担忧。
为什么没有一个社区项目来在消费级硬件上从头训练你自己的LLM?
关于缺乏一个社区项目来在消费级硬件(8GB显存)上使用BitNet和Muon等现代技术从头训练LLM的讨论,提议合作构建这样一个项目。
@heygurisingh: 过去训练参数量达数十亿的LLM需要花费1000万美元以上。有人开源了一个仓库,现在可以在单张GPU上完成。
一个名为train-llm-from-scratch的开源仓库使得在单张GPU上训练十亿级参数的LLM成为可能,它提供了一个从原始文本到推理的可配置流水线,包括数据集流式加载和检查点保存,采用MIT许可证。
AI训练能否像比特币挖矿那样去中心化?[D]
本文探讨了AI训练能否像比特币挖矿那样去中心化,参与者贡献GPU资源训练开源模型以换取代币,并引发了关于验证、虚假梯度和效率等问题的讨论。
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。