销毁书籍来喂养AI模型(历史研究者的观点)

Reddit r/artificial 新闻

摘要

一位历史研究者批评为了获取AI模型训练数据而切割古书书脊的做法,认为这导致了珍贵历史信息和数据的不可逆损失,且无法复原。

我的观点仅代表个人,但我相信会引起许多人的共鸣。当我第一次听说这件事时,令人气愤的是,当你在fb等社交媒体上发布相关信息时,它们的内部服务器会扼杀任何形式的推荐推送(即根据相似兴趣将你的内容推送给更广泛受众的方式),因此原本能获得1000到5000次浏览的内容,现在只有400到500次。我觉得这是一个极其严重的问题,却缺乏任何监督。事实上,机器完全可以不切割书脊就能扫描书籍,但这些方案因为耗时较长而成本稍高。但由于他们切割了书脊,再将其复原是不可能的,因此这些书就被毁掉了。而且他们切割书脊的方式非常糟糕,是实实在在切掉几英寸(而非几毫米)进去。许多1800年前的旧书根本没有页边距,因此大量的数据丢失了。许多书籍可能含有宝贵的隐形信息,只能在紫外线下或通过擦除的字迹才能看到,印记只能通过定向光线才能检测到,还有DNA和压花。在写这篇文章时我还意识到:古书常常会用已经绝版的古书页面重新装订,因此这些书脊极其珍贵,可能包含了10至15世纪手稿的信息。我担心如果政府现在不采取行动,强制公司不许切割书脊并在使用后丢弃一切,人类将会因此变得更加贫乏。
查看原文

相似文章

AI公司正在销毁稀有书籍

Hacker News Top

AI公司大量购买稀有书籍,通过切掉书脊扫描并销毁原书,ISBNdb为其提供便利,一位联邦法官裁定此为合理使用。这种对文化瑰宝的不可逆毁灭引发了众怒。

AI公司大量购入旧书,因其不含AI垃圾

Reddit r/ArtificialInteligence

AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。