ai-training-data

标签

Cards List
#ai-training-data

日本二手书店销量飙升五倍,书籍按吨售出

Hacker News Top ↗ · 20小时前 缓存

日本二手书店销量激增五倍,原因疑似为外国AI科技巨头大量购书用于AI扫描和销毁,引发数据来源伦理担忧。

0 人收藏 0 人点赞
#ai-training-data

Snorkel AI 估值增至35亿美元,AI训练数据需求激增

TechCrunch AI ↗ · 2天前 缓存

Snorkel AI 在完成3.5亿美元的E轮融资后,估值翻三倍至35亿美元,这得益于AI训练数据需求的激增。公司现在专注于数据即服务,通过合成和专家生成的数据提供完整数据集和模拟环境。

0 人收藏 0 人点赞
#ai-training-data

@garrytan: 我觉得说实话Muse会赢。

X AI KOLs Following ↗ · 2026-09-15 缓存

Garry Tan 在推特上表示,Facebook 的 Muse 正在从用户行为中生成有价値的AI训练数据,并将其数据收集与Onavo应用进行比较。

0 人收藏 0 人点赞
#ai-training-data

@signulll: 通过muse,fb可能正在生成的深度个人化且真正可操作的AI训练数据量简直令人震惊。

X AI KOLs Timeline ↗ · 2026-09-15 缓存

该推文强调了Facebook通过其'muse'产品收集大量个人AI训练数据的潜力,将其与Onavo相比较,并指出这可能极大地提升其数据飞轮效应。

0 人收藏 0 人点赞
#ai-training-data

如果AI实验室从相同的公司购买训练数据,是什么让它们的模型有所不同?

Reddit r/ArtificialInteligence ↗ · 2026-09-11

文章探讨了尽管可能使用相同供应商的训练数据,不同实验室的AI模型为何拥有独特优势,例如在编程或写作方面。它指出,美国数据供应商也向中国实验室供货,引发了训练资源重叠的担忧。

0 人收藏 0 人点赞
#ai-training-data

据报道,AfterQuery 成为 Y Combinator 有史以来最快的独角兽公司,目前估值达 32 亿美元。

TechCrunch AI ↗ · 2026-09-01 缓存

AfterQuery 是一家 AI 训练数据初创公司,已成为 Y Combinator 估值 32 亿美元的最快独角兽,距离成立仅 18 个月。该公司与主要 AI 实验室合作,并雇佣知识专业人士进行模型训练。

0 人收藏 0 人点赞
#ai-training-data

AI公司销毁实体书——让我们趁早扫描珍本书籍

Hacker News Top ↗ · 2026-08-21 缓存

AI公司秘密购买并销毁实体书籍以获取训练数据,将知识锁起来,而 Anna's Archive 正敦促志愿者扫描珍本书籍,以防止文化遗产损失。

0 人收藏 0 人点赞
#ai-training-data

空乘人员对谷歌大量购买Spirit航空公司员工数据感到恐慌

Ars Technica ↗ · 2026-08-19 缓存

谷歌正在收购破产的Spirit航空公司的员工数据,引发了空乘人员的隐私担忧,他们担心自己的数据可能得不到充分保护。

0 人收藏 0 人点赞
#ai-training-data

Rocky Linux 创始人 Gregory Kurtzer 推出 OpenWALDO,开放 AI 训练数据

Reddit r/ArtificialInteligence ↗ · 2026-08-11 缓存

Rocky Linux 创始人 Gregory Kurtzer 宣布了 OpenWALDO 项目,旨在开放 AI 训练数据,以促进真正的开源 AI 发展。

0 人收藏 0 人点赞
#ai-training-data

福布斯:Surge AI、Mercor、AfterQuery 和 Turing 每年向腾讯、阿里巴巴和字节跳动出售约5亿美元的训练数据

Reddit r/ArtificialInteligence ↗ · 2026-08-08

据福布斯报道,美国AI数据供应商 Surge AI、Mercor、AfterQuery 和 Turing 每年向中国实验室腾讯、阿里巴巴和字节跳动出售约5亿美元的训练数据,尽管它们同时也在为OpenAI和Anthropic提供服务。

0 人收藏 0 人点赞
#ai-training-data

硅谷的另一个中国问题:它在训练他们的AI

Reddit r/ArtificialInteligence ↗ · 2026-08-05 缓存

这篇《福布斯》文章揭露,像Surge AI和Mercor这样的美国数据标注初创公司正秘密向中国AI实验室出售高质量训练数据,尽管美国实施了芯片限制,但这帮助中国缩小了与美国AI的差距。文章强调了数据基础设施在AI军备竞赛中被忽视的作用,以及围绕专有数据出口的监管盲区。

0 人收藏 0 人点赞
#ai-training-data

AI公司大量购入旧书,因其不含AI垃圾

Reddit r/ArtificialInteligence ↗ · 2026-07-21 缓存

AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。

0 人收藏 0 人点赞
#ai-training-data

当人工智能耗尽人类生成的数据时会发生什么?

Reddit r/ArtificialInteligence ↗ · 2026-07-16

随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。

0 人收藏 0 人点赞
#ai-training-data

你知道吗?OpenAI CEO 持有 Reddit 近 9% 股份,而 Reddit 却封禁 AI 生成内容的用户

Reddit r/artificial ↗ · 2026-07-14

OpenAI 首席执行官 Sam Altman 持有 Reddit 近 9% 的股份,成为第三大股东;与此同时,Reddit 封禁发布 AI 生成内容的用户,却将用户数据出售给 Google 用于 AI 训练,这凸显了利益冲突。

0 人收藏 0 人点赞
#ai-training-data

Stripe 可能是为前沿AI提供数据的最强渠道之一

Reddit r/ArtificialInteligence ↗ · 2026-07-02

有观点认为,Stripe 是向前沿AI模型提供数据的主要来源之一,这凸显了其在AI发展中的作用。

0 人收藏 0 人点赞
#ai-training-data

剩余AI训练数据中相当大一部分存储在仓库的磁带上

Reddit r/artificial ↗ · 2026-06-24

大量剩余的AI训练数据以未数字化的形式存储在仓库的磁带上,这突显了在基于互联网的数据耗尽时的一个潜在数据来源

0 人收藏 0 人点赞
#ai-training-data

科技公司极度渴望拍摄你做家务的画面

The Verge ↗ · 2026-05-29 缓存

Shift和Pronto等科技公司正提供免费服务或付费,记录人们做家务的过程,以收集物理AI和机器人训练数据,引发了隐私和伦理问题。

0 人收藏 0 人点赞
#ai-training-data

LQS v3.1 — 一种用于评估AI训练数据的开放方法(多预言机共识 + 签名证书)[P]

Reddit r/MachineLearning ↗ · 2026-05-23

作者介绍了LQS v3.1,一种使用多预言机共识和签名证书评估AI训练数据的开放方法,并附有已发表的论文和公共指数。该方法旨在解决AI训练数据市场中独立质量评估的瓶颈问题。

0 人收藏 0 人点赞
#ai-training-data

Anna's Archive 遭1950万美元缺席判决及全球域名下架令

Hacker News Top ↗ · 2026-05-20 缓存

在主要出版商因版权侵权及该网站被用作人工智能公司训练数据枢纽而提起诉讼后,纽约联邦法官批准了对影子图书馆 Anna's Archive 的1950万美元缺席判决,并下令全球域名下架。

0 人收藏 0 人点赞
#ai-training-data

Meta员工在大裁员前夕抗议新推出的鼠标追踪软件

Reddit r/ArtificialInteligence ↗ · 2026-05-13 缓存

Meta员工正在抗议公司新推出的鼠标追踪软件——模型能力倡议(Model Capability Initiative),他们认为这构成了一种侵入性监控,而此举正值大规模裁员前夕。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈