剩余AI训练数据中相当大一部分存储在仓库的磁带上
摘要
大量剩余的AI训练数据以未数字化的形式存储在仓库的磁带上,这突显了在基于互联网的数据耗尽时的一个潜在数据来源
我一直在了解AI训练数据短缺的情况,有一个方面是没有人考虑到的:大量可用的潜在训练数据并非存储在数据库系统中,而是储存在几十年来一直保存在恒温存储柜中的旧磁带上。从80年代到2000年代,所有大型企业、政府机构、医院、电视台和实验室都将所有数据备份到磁带上。这些数据大多没有被数字化或正确索引。随着私有LLM的发展,事实证明公司拥有的最佳数据集就放在盒装的磁带上。根据我所看到的所有预测,基于互联网的训练数据的增长将在某个时候停止,大约在2026年。后续的训练数据可以通过对旧资料的归档来获取。
相似文章
当人工智能耗尽人类生成的数据时会发生什么?
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
边缘数据(9分钟阅读)
人工智能通过更便宜的传感器、机器人技术和多模态模型,正在实现从物理世界收集和处理以前无法访问的数据,在基础设施、医疗保健和工业自动化领域创建新的数据飞轮。
我认为AI训练比人们想象的要容易得多
作者认为,由于廉价的GPU租赁和AI驱动的工具,AI训练如今已经广泛可及,但许多人盲目使用未经验证的低质量数据,导致结果不佳和资源浪费。
AI网络数据基础设施层的出现
本文讨论了为AI模型提供新鲜、实时、可信数据而对网络数据基础设施层日益增长的需求,强调了静态训练数据等挑战以及检索增强生成的重要性。
数据并不稀缺,稀缺的是你的想象力(8分钟阅读)
Asuka Zheng认为,关于'训练数据即将耗尽'的恐慌是错位的;真正的稀缺在于收集多样化、长周期数据时的想象力不足,她用自己的SRE替代项目及更广泛的研究趋势说明了这一点。