AI公司大量购买古籍,摄取内容训练模型后销毁,即便存世极少
摘要
AI公司购买并销毁稀有实体书籍,以获取不含AI生成内容的训练数据,利用合理使用和首次销售原则等法律原则,同时引发伦理和保存方面的担忧。
暂无内容
查看缓存全文
缓存时间: 2026/07/27 01:50
# 人工智能公司正在大量购买古籍,将其内容输入模型训练,然后以惊人规模销毁,即使几乎已无副本留存
来源:https://futurism.com/artificial-intelligence/ai-companies-destroying-rare-books
## 订阅我们,预见未来
来自科技前沿不容错过的创新
传统上,书籍有两样好处:阅读,以及摆放在书架上赏心悦目。
但人工智能公司对这两样都不感兴趣。
对于构建大型语言模型的人来说,书籍不过是批量吞噬、再像鱼骨头一样吐出来的饲料。他们通常乐于使用数字书籍——甚至更好的是,*盗版*数字书籍——正如 Meta 被指控的那样,以及 Anthropic 因同样行为而被判支付 15 亿美元和解金给作者。
但许多公司,包括 Anthropic,已转而使用实体书籍,他们可以廉价购买无数二手书。根据已和解的诉讼,Anthropic 使用一台液压动力切割机,整齐地撕掉从书商那里购得的书籍的书页,然后用工业级成像设备进行扫描。换句话说,它literally 撕毁作者书籍来训练其 AI。
这一过程利用了被称为“首次销售原则”的法律概念,允许买家随心所欲地处理所购物品,无需原版权所有者同意。由于 Anthropic 将原始实体文本转化为数字文本——而不是作为新副本重新分发——法官裁定这属于“变革性”使用,因此受到合理使用保护。
现在,据 *404 Media* 报道,这种做法已变得如此普遍,甚至连老牌书商也在寻求从 AI 热潮中获利。一家名为 ISBNdb 的公司宣称拥有“世界上最大的图书数据库”,并鼓吹“世界上最好的 AI 训练数据就放在书架上”,认为这些实体文本未受低劣 AI 写作的污染——后者已经污染了大量互联网(事实上也包括新书)。
“大语言模型时代之前的印刷书籍在结构上保证了不会受到这种污染。仅这一点就是巨大的优势,”*404* 援引该公司网站上的一篇文章解释道,“在这个日期(2022年之前)之前出版的实体书籍在结构上是纯净的,不含现代投毒工具。”
据 *404* 报道,ISBNdb 曾专注于帮助图书馆、分销商和书店寻找和销售书籍,现在则帮助 AI 公司批量购买,每单从 1,000 到 100 万本书不等。
作为额外福利,它还承诺 AI 公司会对购买保密——显然,没人想成为像 Anthropic 和 Meta 那样的焦点——同时清楚地意识到这种做法听起来有多么可疑。
“形象问题确实存在,”ISBNdb 网站表示,“‘AI 公司销毁两百万本书’可不是一个能博得同情的标题。”
一位小型书商称,今年四月,他突然从每周卖出不超过 20 本书变成卖出数百本,他几乎可以肯定客户是 AI 实验室,因为书籍选择随机,且都带有 ISBN。他还说,自己的库存中满是珍稀和绝版书,这意味着 AI 公司可能正在销毁仅存的一些可寻副本。
“我个人对此心情复杂,”该书商告诉 *404*。“这让我在经济上受益,同时也清理了原本不太可能售出的陈旧库存。我的海外和外语书籍库存非常适合这类销售。另一方面,我不喜欢最终用途,也不喜欢珍稀书籍被化浆。”
更多古籍可能面临危险。*404* 指出,荷兰的珍稀书商正被大量批量购买所淹没——他们相信这些购买是 AI 公司所为,尽管无法确定。
整个行业都有类似的怀疑。像 ISBNdb 这样的服务促进了这些批量订单,如约保持 AI 买家的匿名性。可能有强烈迹象表明某个批量订单是为了 AI 实验室,但书商在大多数情况下只能猜测。
**更多 AI 相关内容:** *作者受邀在 OpenAI 总部演讲,趁机当面痛骂 AI*
相似文章
AI公司正在销毁稀有书籍
AI公司大量购买稀有书籍,通过切掉书脊扫描并销毁原书,ISBNdb为其提供便利,一位联邦法官裁定此为合理使用。这种对文化瑰宝的不可逆毁灭引发了众怒。
AI公司大量购入旧书,因其不含AI垃圾
AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。
@danshipper:如果属实,这很糟糕,不该再对稀有书籍这样做了
据报道,人工智能公司正在批量购买稀有书籍,通过切割书脊并粉碎原本来进行扫描,这项操作由名为ISBNdb的服务提供便利,引发了道德担忧。
AI儿童图书:身体恐怖版
分析亚马逊上的AI生成儿童书籍,指出普遍存在的质量问题和怪异的视觉错误(即“身体恐怖”),这些问题削弱了先进AI模型的前景。
AI只是更大规模的无授权抄袭
作者认为,AI模型通过未经同意训练受版权保护的内容构成无授权抄袭,并且AI生成的仿冒品在搜索结果中排名超过了原创者。