剩余AI训练数据中相当大一部分存储在仓库的磁带上

Reddit r/artificial 新闻

摘要

大量剩余的AI训练数据以未数字化的形式存储在仓库的磁带上,这突显了在基于互联网的数据耗尽时的一个潜在数据来源

我一直在了解AI训练数据短缺的情况,有一个方面是没有人考虑到的:大量可用的潜在训练数据并非存储在数据库系统中,而是储存在几十年来一直保存在恒温存储柜中的旧磁带上。从80年代到2000年代,所有大型企业、政府机构、医院、电视台和实验室都将所有数据备份到磁带上。这些数据大多没有被数字化或正确索引。随着私有LLM的发展,事实证明公司拥有的最佳数据集就放在盒装的磁带上。根据我所看到的所有预测,基于互联网的训练数据的增长将在某个时候停止,大约在2026年。后续的训练数据可以通过对旧资料的归档来获取。
查看原文

相似文章

边缘数据(9分钟阅读)

TLDR AI

人工智能通过更便宜的传感器、机器人技术和多模态模型,正在实现从物理世界收集和处理以前无法访问的数据,在基础设施、医疗保健和工业自动化领域创建新的数据飞轮。

我认为AI训练比人们想象的要容易得多

Reddit r/artificial

作者认为,由于廉价的GPU租赁和AI驱动的工具,AI训练如今已经广泛可及,但许多人盲目使用未经验证的低质量数据,导致结果不佳和资源浪费。

AI网络数据基础设施层的出现

MIT Technology Review

本文讨论了为AI模型提供新鲜、实时、可信数据而对网络数据基础设施层日益增长的需求,强调了静态训练数据等挑战以及检索增强生成的重要性。