标签
据福布斯报道,美国AI数据供应商 Surge AI、Mercor、AfterQuery 和 Turing 每年向中国实验室腾讯、阿里巴巴和字节跳动出售约5亿美元的训练数据,尽管它们同时也在为OpenAI和Anthropic提供服务。
这篇《福布斯》文章揭露,像Surge AI和Mercor这样的美国数据标注初创公司正秘密向中国AI实验室出售高质量训练数据,尽管美国实施了芯片限制,但这帮助中国缩小了与美国AI的差距。文章强调了数据基础设施在AI军备竞赛中被忽视的作用,以及围绕专有数据出口的监管盲区。
AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
OpenAI 首席执行官 Sam Altman 持有 Reddit 近 9% 的股份,成为第三大股东;与此同时,Reddit 封禁发布 AI 生成内容的用户,却将用户数据出售给 Google 用于 AI 训练,这凸显了利益冲突。
有观点认为,Stripe 是向前沿AI模型提供数据的主要来源之一,这凸显了其在AI发展中的作用。
大量剩余的AI训练数据以未数字化的形式存储在仓库的磁带上,这突显了在基于互联网的数据耗尽时的一个潜在数据来源
Shift和Pronto等科技公司正提供免费服务或付费,记录人们做家务的过程,以收集物理AI和机器人训练数据,引发了隐私和伦理问题。
作者介绍了LQS v3.1,一种使用多预言机共识和签名证书评估AI训练数据的开放方法,并附有已发表的论文和公共指数。该方法旨在解决AI训练数据市场中独立质量评估的瓶颈问题。
在主要出版商因版权侵权及该网站被用作人工智能公司训练数据枢纽而提起诉讼后,纽约联邦法官批准了对影子图书馆 Anna's Archive 的1950万美元缺席判决,并下令全球域名下架。
Meta员工正在抗议公司新推出的鼠标追踪软件——模型能力倡议(Model Capability Initiative),他们认为这构成了一种侵入性监控,而此举正值大规模裁员前夕。
Meta被指控非法从LibGen、Anna's Archive和Z-Library下载超过80TB的书籍用于训练AI模型。文章对比了Aaron Swartz因下载少量论文而面临严厉指控的案例,突显了版权执法中的双重标准问题。