与其搞去中心化训练,不如构建“统一数据集”

Reddit r/LocalLLaMA 新闻

摘要

一个论点:开源社区不应专注于去中心化训练LLM,而应协作创建一个大型、高质量、类似BitTorrent那样可在人们计算机上获取的预训练数据集。

这里有很多帖子呼吁联合训练一个新的开放模型LLM。主要原因是在政府禁止商业前沿模型的噱头之后,以及最近缺乏中小型开源权重模型的发布。我真的相信在某个时候我们会拥有“SETI for LLM”。但不会很快,不是今年。它需要对高延迟网络上的训练算法进行严肃的基础研究。我认为更有价值的是为未来的这种训练运行准备预训练数据。这远非“超级困难”的任务。可以发明类似于BitTorrent下载器的客户端(氛围工程),用于从互联网抓取、清理和托管(共享)数据。一个拥有数万亿高质量token的全球新数据库,公开可用,托管在人们的计算机上,将是开源社区向那些窃取我们数据和VRAM的亿万富翁们传递的真正信息。我们不要梦想在家用GPU上进行分布式LLM训练。我们应该专注于更实际的事情。仅仅是这样一个数据集的存在,就会自行加速分布式训练的发展。
查看原文

相似文章

LocalLLaMA 众包编程数据集

Reddit r/LocalLLaMA

一位社区成员提议为本地大语言模型创建一个众包编程数据集,以实现协作模型训练和微调,并回应了关于未来开源权重模型可用性的担忧。

AI训练能否像比特币挖矿那样去中心化?[D]

Reddit r/MachineLearning

本文探讨了AI训练能否像比特币挖矿那样去中心化,参与者贡献GPU资源训练开源模型以换取代币,并引发了关于验证、虚假梯度和效率等问题的讨论。