标签
日本二手书店销量激增五倍,原因疑似为外国AI科技巨头大量购书用于AI扫描和销毁,引发数据来源伦理担忧。
Snorkel AI 在完成3.5亿美元的E轮融资后,估值翻三倍至35亿美元,这得益于AI训练数据需求的激增。公司现在专注于数据即服务,通过合成和专家生成的数据提供完整数据集和模拟环境。
Garry Tan 在推特上表示,Facebook 的 Muse 正在从用户行为中生成有价値的AI训练数据,并将其数据收集与Onavo应用进行比较。
该推文强调了Facebook通过其'muse'产品收集大量个人AI训练数据的潜力,将其与Onavo相比较,并指出这可能极大地提升其数据飞轮效应。
文章探讨了尽管可能使用相同供应商的训练数据,不同实验室的AI模型为何拥有独特优势,例如在编程或写作方面。它指出,美国数据供应商也向中国实验室供货,引发了训练资源重叠的担忧。
AfterQuery 是一家 AI 训练数据初创公司,已成为 Y Combinator 估值 32 亿美元的最快独角兽,距离成立仅 18 个月。该公司与主要 AI 实验室合作,并雇佣知识专业人士进行模型训练。
AI公司秘密购买并销毁实体书籍以获取训练数据,将知识锁起来,而 Anna's Archive 正敦促志愿者扫描珍本书籍,以防止文化遗产损失。
谷歌正在收购破产的Spirit航空公司的员工数据,引发了空乘人员的隐私担忧,他们担心自己的数据可能得不到充分保护。
Rocky Linux 创始人 Gregory Kurtzer 宣布了 OpenWALDO 项目,旨在开放 AI 训练数据,以促进真正的开源 AI 发展。
据福布斯报道,美国AI数据供应商 Surge AI、Mercor、AfterQuery 和 Turing 每年向中国实验室腾讯、阿里巴巴和字节跳动出售约5亿美元的训练数据,尽管它们同时也在为OpenAI和Anthropic提供服务。
这篇《福布斯》文章揭露,像Surge AI和Mercor这样的美国数据标注初创公司正秘密向中国AI实验室出售高质量训练数据,尽管美国实施了芯片限制,但这帮助中国缩小了与美国AI的差距。文章强调了数据基础设施在AI军备竞赛中被忽视的作用,以及围绕专有数据出口的监管盲区。
AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
OpenAI 首席执行官 Sam Altman 持有 Reddit 近 9% 的股份,成为第三大股东;与此同时,Reddit 封禁发布 AI 生成内容的用户,却将用户数据出售给 Google 用于 AI 训练,这凸显了利益冲突。
有观点认为,Stripe 是向前沿AI模型提供数据的主要来源之一,这凸显了其在AI发展中的作用。
大量剩余的AI训练数据以未数字化的形式存储在仓库的磁带上,这突显了在基于互联网的数据耗尽时的一个潜在数据来源
Shift和Pronto等科技公司正提供免费服务或付费,记录人们做家务的过程,以收集物理AI和机器人训练数据,引发了隐私和伦理问题。
作者介绍了LQS v3.1,一种使用多预言机共识和签名证书评估AI训练数据的开放方法,并附有已发表的论文和公共指数。该方法旨在解决AI训练数据市场中独立质量评估的瓶颈问题。
在主要出版商因版权侵权及该网站被用作人工智能公司训练数据枢纽而提起诉讼后,纽约联邦法官批准了对影子图书馆 Anna's Archive 的1950万美元缺席判决,并下令全球域名下架。
Meta员工正在抗议公司新推出的鼠标追踪软件——模型能力倡议(Model Capability Initiative),他们认为这构成了一种侵入性监控,而此举正值大规模裁员前夕。