AI公司大量购买古籍,摄取内容训练模型后销毁,即便存世极少

Reddit r/singularity 新闻

摘要

AI公司购买并销毁稀有实体书籍,以获取不含AI生成内容的训练数据,利用合理使用和首次销售原则等法律原则,同时引发伦理和保存方面的担忧。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/27 01:50

# 人工智能公司正在大量购买古籍,将其内容输入模型训练,然后以惊人规模销毁,即使几乎已无副本留存 来源:https://futurism.com/artificial-intelligence/ai-companies-destroying-rare-books ## 订阅我们,预见未来 来自科技前沿不容错过的创新 传统上,书籍有两样好处:阅读,以及摆放在书架上赏心悦目。 但人工智能公司对这两样都不感兴趣。 对于构建大型语言模型的人来说,书籍不过是批量吞噬、再像鱼骨头一样吐出来的饲料。他们通常乐于使用数字书籍——甚至更好的是,*盗版*数字书籍——正如 Meta 被指控的那样,以及 Anthropic 因同样行为而被判支付 15 亿美元和解金给作者。 但许多公司,包括 Anthropic,已转而使用实体书籍,他们可以廉价购买无数二手书。根据已和解的诉讼,Anthropic 使用一台液压动力切割机,整齐地撕掉从书商那里购得的书籍的书页,然后用工业级成像设备进行扫描。换句话说,它literally 撕毁作者书籍来训练其 AI。 这一过程利用了被称为“首次销售原则”的法律概念,允许买家随心所欲地处理所购物品,无需原版权所有者同意。由于 Anthropic 将原始实体文本转化为数字文本——而不是作为新副本重新分发——法官裁定这属于“变革性”使用,因此受到合理使用保护。 现在,据 *404 Media* 报道,这种做法已变得如此普遍,甚至连老牌书商也在寻求从 AI 热潮中获利。一家名为 ISBNdb 的公司宣称拥有“世界上最大的图书数据库”,并鼓吹“世界上最好的 AI 训练数据就放在书架上”,认为这些实体文本未受低劣 AI 写作的污染——后者已经污染了大量互联网(事实上也包括新书)。 “大语言模型时代之前的印刷书籍在结构上保证了不会受到这种污染。仅这一点就是巨大的优势,”*404* 援引该公司网站上的一篇文章解释道,“在这个日期(2022年之前)之前出版的实体书籍在结构上是纯净的,不含现代投毒工具。” 据 *404* 报道,ISBNdb 曾专注于帮助图书馆、分销商和书店寻找和销售书籍,现在则帮助 AI 公司批量购买,每单从 1,000 到 100 万本书不等。 作为额外福利,它还承诺 AI 公司会对购买保密——显然,没人想成为像 Anthropic 和 Meta 那样的焦点——同时清楚地意识到这种做法听起来有多么可疑。 “形象问题确实存在,”ISBNdb 网站表示,“‘AI 公司销毁两百万本书’可不是一个能博得同情的标题。” 一位小型书商称,今年四月,他突然从每周卖出不超过 20 本书变成卖出数百本,他几乎可以肯定客户是 AI 实验室,因为书籍选择随机,且都带有 ISBN。他还说,自己的库存中满是珍稀和绝版书,这意味着 AI 公司可能正在销毁仅存的一些可寻副本。 “我个人对此心情复杂,”该书商告诉 *404*。“这让我在经济上受益,同时也清理了原本不太可能售出的陈旧库存。我的海外和外语书籍库存非常适合这类销售。另一方面,我不喜欢最终用途,也不喜欢珍稀书籍被化浆。” 更多古籍可能面临危险。*404* 指出,荷兰的珍稀书商正被大量批量购买所淹没——他们相信这些购买是 AI 公司所为,尽管无法确定。 整个行业都有类似的怀疑。像 ISBNdb 这样的服务促进了这些批量订单,如约保持 AI 买家的匿名性。可能有强烈迹象表明某个批量订单是为了 AI 实验室,但书商在大多数情况下只能猜测。 **更多 AI 相关内容:** *作者受邀在 OpenAI 总部演讲,趁机当面痛骂 AI*

相似文章

AI公司正在销毁稀有书籍

Hacker News Top

AI公司大量购买稀有书籍,通过切掉书脊扫描并销毁原书,ISBNdb为其提供便利,一位联邦法官裁定此为合理使用。这种对文化瑰宝的不可逆毁灭引发了众怒。

书商怀疑AI公司购买并销毁稀有书籍

Ars Technica

AI公司被怀疑购买并销毁稀有书籍以用作训练数据,这引起了书商和书籍爱好者们的担忧。文章将此与互联网档案馆谨慎的人工驱动扫描流程以及谷歌的非破坏性专利进行了对比,并指出这些是可行的替代方案。

@interjc: don’t be evil

X AI KOLs Following

AI公司正在购买并销毁实体书籍(包括稀有副本)以训练其模型,这引发了关于文化遗产处理的道德和法律担忧。