销毁书籍来喂养AI模型(历史研究者的观点)
摘要
一位历史研究者批评为了获取AI模型训练数据而切割古书书脊的做法,认为这导致了珍贵历史信息和数据的不可逆损失,且无法复原。
我的观点仅代表个人,但我相信会引起许多人的共鸣。当我第一次听说这件事时,令人气愤的是,当你在fb等社交媒体上发布相关信息时,它们的内部服务器会扼杀任何形式的推荐推送(即根据相似兴趣将你的内容推送给更广泛受众的方式),因此原本能获得1000到5000次浏览的内容,现在只有400到500次。我觉得这是一个极其严重的问题,却缺乏任何监督。事实上,机器完全可以不切割书脊就能扫描书籍,但这些方案因为耗时较长而成本稍高。但由于他们切割了书脊,再将其复原是不可能的,因此这些书就被毁掉了。而且他们切割书脊的方式非常糟糕,是实实在在切掉几英寸(而非几毫米)进去。许多1800年前的旧书根本没有页边距,因此大量的数据丢失了。许多书籍可能含有宝贵的隐形信息,只能在紫外线下或通过擦除的字迹才能看到,印记只能通过定向光线才能检测到,还有DNA和压花。在写这篇文章时我还意识到:古书常常会用已经绝版的古书页面重新装订,因此这些书脊极其珍贵,可能包含了10至15世纪手稿的信息。我担心如果政府现在不采取行动,强制公司不许切割书脊并在使用后丢弃一切,人类将会因此变得更加贫乏。
相似文章
AI公司大量购买古籍,摄取内容训练模型后销毁,即便存世极少
AI公司购买并销毁稀有实体书籍,以获取不含AI生成内容的训练数据,利用合理使用和首次销售原则等法律原则,同时引发伦理和保存方面的担忧。
AI公司正在销毁稀有书籍
AI公司大量购买稀有书籍,通过切掉书脊扫描并销毁原书,ISBNdb为其提供便利,一位联邦法官裁定此为合理使用。这种对文化瑰宝的不可逆毁灭引发了众怒。
@danshipper:如果属实,这很糟糕,不该再对稀有书籍这样做了
据报道,人工智能公司正在批量购买稀有书籍,通过切割书脊并粉碎原本来进行扫描,这项操作由名为ISBNdb的服务提供便利,引发了道德担忧。
AI公司大量购入旧书,因其不含AI垃圾
AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。
是否应该因担心恶意行为者而禁止公众访问极其强大的模型?开源是否鲁莽?
本文探讨了是否应限制对强大AI模型的访问以防止恶意行为者滥用,或将其开源以实现公平访问,权衡了权力集中与社会危害的风险。它建议采取折中方案,引用了Anthropic设置护栏的方法,但也承认了其局限性和权衡。