在受版权保护的书籍上训练AI模型是否合法?情况复杂

TechCrunch AI 新闻

摘要

本文探讨了在受版权保护的书籍上训练AI模型的法律复杂性,重点介绍了涉及Anthropic的一起法庭案件,以及将过时的版权法应用于现代AI技术所面临的挑战。

大多数已出版的作者在不知情或未同意的情况下,为那些威胁到他们生计的同一AI工具的发展做出了贡献。这看起来不合法,对吧?
查看原文
查看缓存全文

缓存时间: 2026/08/23 16:42

# 在版权书籍上训练AI模型是否合法?情况很复杂 | TechCrunch 来源:https://techcrunch.com/2026/08/23/is-it-legal-to-train-ai-models-on-copyrighted-books-its-complicated/ 你可能已经知道,驱动ChatGPT、Gemini、Claude和其他聊天机器人的AI模型是基于看似无限的已出版作品数据库进行训练的,其中包含数亿本书籍、在线文章、学术论文,以及基本上你在网上能找到的所有东西。大多数已出版的作者在不知情或未同意的情况下,为这些同样威胁其生计的AI工具的发展做出了贡献。这看起来似乎违法,对吧? 现实并非如此简单。 “我认为这个法律领域和整个技术领域的一个问题在于,这里面涉及的事情太多了,”知识产权、版权和技术领域的律师Cathy Gellis告诉TechCrunch。“情况非常复杂,人们对正在发生的事情有很多强烈的情绪,支持和反对的都有。” 去年,在首批此类裁决之一中,法官William Alsup命令Anthropic向一群作家支付高达15亿美元的版权和解金,这些作家的作品被用于训练该公司的AI模型。表面上看,这似乎是有利于作者的道德胜利,但Alsup法官实际上裁定Anthropic的AI训练是合法的。他处罚Anthropic的原因是该公司从非法的在线影子图书馆盗版这些书籍。 “就像任何有志于成为作家的读者一样,Anthropic的LLM训练学习作品并非为了赶超、复制或取代它们——而是为了转向并创造不同的东西,”法官写道,他将LLM吸收数万亿个词的方式比作作家对文学的研究。 Gellis认为这项裁决对AI公司更为有利。对于一家预计到2028年年收入约2000亿美元(https://www.reuters.com/business/anthropic-ipo-valuation-hinges-190-200-billion-2028-revenue-forecast-sources-say-2026-08-15/)的公司来说,15亿美元的罚款算什么呢? “我认为,对于AI训练来说,这总体上是个好消息,因为他审视了实际情况,并真正将其类比为阅读受版权保护的作品,而不是复制受版权保护的作品,”Gellis说。“版权法的关键在于复制,但它并不关乎使用该作品、体验该作品、消费该作品或阅读该作品。” 自1976年以来,版权法从未更新(https://en.wikipedia.org/wiki/Copyright_Act_of_1976),这意味着当法官面对可能塑造AI产业未来的法律问题时,他们必须设法解释50年前的准则。 “现在每个人都非常担心,因为法律一团糟,这都是因为这个问题,”JWL International知识产权与媒体实践部高级律师兼创始人Jason Henderson告诉TechCrunch。“他们知道AI模型是在海量数据上训练的,而法律还没有真正跟上这个问题。” 这些问题通常取决于合理使用法律——具体来说,使用受版权保护的作品是否具有足够的“转换性”,从而在法律上被视为允许。 合理使用是版权法中的一个例外,允许在未经明确许可的情况下使用受版权保护的材料,旨在保护通过批评、戏仿、教育等方式对受版权保护作品进行评论和迭代的能力。法官在判断是否构成合理使用时会考虑特定因素,包括作品的目的和性质、使用量以及对市场的影响。 “版权始终关乎保护和扩大市场,”Henderson指出。“法院在推理方面(在AI案件中)有些混乱。倾向于胜出的情况是,如果你的行为是基于某人的财产进行训练,因为你的目的是直接竞争,那么法院会反对……如果你的行为不会与之竞争,那么法院倾向于找到方法使其变得可以接受。” Henderson指的是媒体和科技公司Thomson Reuters起诉研究公司Ross Intelligence的案件,后者复制其内容以建立一个基于AI的、具有竞争性的法律平台。 “Ross的使用不具有转换性,因为它没有不同于Thomson Reuters的‘进一步目的或不同性质’,”法官Stephanos Bibas去年写道(https://fingfx.thomsonreuters.com/gfx/legaldocs/xmvjbznbkvr/THOMSON%20REUTERS%20ROSS%20LAWSUIT%20fair%20use.pdf)。 在该案中,Bibas法官认定,利用路透社的内容来训练一个将与其直接竞争的新平台,不属于合理使用。虽然作者们可能会辩称聊天机器人通过使用其作品来生成新的、合成的书籍从而与之竞争,但这一论点尚未在法庭上胜诉。 当谈到AI与版权的关系时,Gellis发现明确我们讨论的范围很有帮助——我们关于AI训练的版权思考方式,与我们如何考虑AI生成内容的版权保护有很大不同。 在一个案例中,Thaler诉Perlmutter案(https://law.justia.com/cases/federal/appellate-courts/cadc/23-5233/23-5233-2025-03-18.html),法院裁定,如果一个作品是100%由AI生成的,它就不具有可版权性,这就引发了一系列新的问题——我们如何确凿地证明一个作品是否使用了AI生成?如果是,我们又如何知道其中有多大比例是AI创建或辅助完成的? “如果你在[微软]Word中写小说并运行拼写检查,我们基本上可以放心地说Word并不拥有你的小说,”Gellis说。“[AI]正在迫使我们审视一大堆我们过去有些忽视的决定。” 大多数AI公司仍因这些问题而陷入待决诉讼中,这意味着我们不会很快得到明确的解决方案。 “你看到的是,最初的几轮交锋正在产生影响,这种影响本身可能会因为其他法院做出不同的决定而被推翻,需要在诉讼的后期阶段才能弄清楚哪个会胜出,”Gellis说。“但与此同时,所有这些决定都在塑造正在发生的一切。AI公司忽略这些决定可能会显得有些愚蠢。” *当你通过文章中的链接购买商品时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*

相似文章

Anthropic 里程碑式的 15 亿美元版权和解获批

TechCrunch AI

一位联邦法官批准了 Anthropic 就 AI 训练中使用盗版书籍的版权集体诉讼达成的 15 亿美元和解,同时法院裁定,在受版权保护的文本上训练 AI 本身属于合理使用。

为什么关于用版权法阻止AI的讨论这么少?

Reddit r/ArtificialInteligence

讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。