微软高管称AI抓取为‘人类历史上最大的劳动盗窃’,最新未删节文件揭示
摘要
诉讼中的新未删节文件揭示,微软高管描述AI抓取为‘人类历史上最大的劳动盗窃’,并内部承认AI对出版商如The New York Times的影响。
最新解封的法庭文件显示,微软私下称OpenAI的数据实践为‘盗窃’,而两家公司都抓取了付费墙后的The New York Times内容,构建数据集,并内部警告这将摧毁出版商。
查看缓存全文
缓存时间: 2026/09/17 21:13
# 微软高管称AI抓取是“人类历史上最大规模的劳动盗窃”,最新解密文件揭示 | TechCrunch
来源:https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/
《纽约时报》三年前起诉OpenAI和微软的版权诉讼案中,最新解密信息显示,微软高管曾私下承认AI抓取等同于盗窃,并指出AI产品对出版业构成重大威胁。
诉讼文件指出,微软高管曾将公司的AI训练实践称为“盗窃”,而OpenAI领导层也承认,其AI模型对那些作品被用于训练的出版商和记者构成了“生存威胁”。
解密材料还详细说明了这两家公司如何通过绕过付费墙、大规模抓取构建训练数据集,以及刻意删除训练数据中的版权信息来获取和使用这些内容。
需要指出的是,新增信息主要来自《纽约时报》的诉讼摘要,而非仍处于封存状态的原始证据材料。以下引用均脱离了原始语境。
这份解密文件标志着这起持续三年的诉讼再度升级。《纽约时报》最初指控这两家公司通过生成式AI模型使用其内容训练侵犯了版权法。
AI公司能否合法使用版权材料训练AI目前尚无定论,但法官大多倾向于支持AI公司的“合理使用”抗辩。这一法律原则允许在特定情况下(如戏仿、新闻报道或批评)未经许可使用版权作品。本月早些时候,特朗普政府提交了一份法庭之友意见书,为OpenAI未经许可使用版权材料训练大语言模型进行辩护。
然而,新增的多项承认与OpenAI的合理使用抗辩相矛盾,特别是该原则要求使用行为不得替代或损害原作市场。例如,微软自身数据显示,其Copilot“答案引擎”使《纽约时报》网站的点击率较传统Bing搜索最高下降了93%。微软应用科学总监布伦特·赫克特2024年1月撰写的内部演示文稿将此描述为“死亡螺旋”,称其将“同时损害我们的模型表现和整个网络生态”。
微软文件中引用的诉讼内容指出:“最终产品威胁其核心供应商的经济基础极为罕见,但这正是我们为大语言模型业务创造的‘内容供应链’现状。”
微软CEO萨提亚·纳德拉今年早些时候也在证词中表示:“任何付费墙内容,使用者都应该获取许可……用于语境锚定或训练”,并明确表示如果得知OpenAI抓取并训练了付费墙后的内容,他会“行使[微软要求OpenAI重新训练模型的]权利”。
其他承认内容也动摇了合理使用原则的其他支柱:OpenAI ChatGPT负责人尼克·图利在内部通讯中写道,出版商面临来自这类聊天机器人的“生存威胁”,它们具有“高度替代性”,且“随着性能提升将越来越具替代性”。
OpenAI总裁格雷格·布罗克曼称这些模型“非常擅长处理新闻”。纳德拉今年早些时候宣誓作证时也同意,与聊天机器人对话“已经替代了……在AI平台上直接获取信息,而无需访问原始来源”。
这种表述揭示了该技术如何可能直接竞争而非转化原作。
微软文件指出,生成式AI“确实存在重大风险”,可能“严重扰乱那些为生成模型提供数据的人们的就业”。
复制规模之大令人震惊。文件首次披露,仅OpenAI的中期训练数据集就包含超过91,692份来自《纽约时报》《每日新闻》和调查报道中心的作品副本。而源自Common Crawl的数据集中,仅nytimes.com的文档就超过200万份。
赫克特在2023年1月的内部备忘录中称之为“规模空前的惊人盗窃”,是“人类历史上最大规模的劳动盗窃”。
文件详细说明了OpenAI和微软获取原告内容的方式,包括从Bing索引中抓取。
诉讼文件显示:“OpenAI将完整的GPT-3训练数据集交付给微软,微软用以评估如何在其商业产品中应用OpenAI模型。微软同样通过‘出租车计划’和‘芒果计划’向OpenAI提供训练数据。”
据称这两家公司通过芒果计划将数据整合为包含至少160,903份新闻出版商独特作品的训练数据集。
为最大化抓取效益,OpenAI员工据称制定了绕过付费墙而不被检测的计划。文件显示,当OpenAI研究员尼克·莱德向布罗克曼提及“绕过《纽约时报》付费墙的技巧”时,布罗克曼回复:“啊不错。”
据称OpenAI员工还构建了过度依赖抓取新闻内容的WebText和WebText2等训练数据集,并从免费开放的网页抓取数据库Common Crawl中获取了数百万篇文章。研究人员认为不应让模型向用户输出“版权信息”,因此据称在数据进入模型前会刻意删除训练数据中的版权声明。
OpenAI和微软未回应置评请求。
*当您通过文章中的链接购买时,我们可能获得小额佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不影响我们的编辑独立性。*
相似文章
微软高管称AI抓取为“人类历史上最大的劳动盗窃”
微软和OpenAI的内部文件揭示了高管们的担忧:AI抓取新闻内容是“人类历史上最大的劳动盗窃”,并可能创造一个“末日循环”,损害新闻机构和模型性能。
OpenAI 和 Microsoft 知道他们正在为网络开启一个‘末日循环’
法院文件显示,OpenAI 和 Microsoft 知道他们为AI训练进行的数据抓取行为可能会创建一个损害网络的‘末日循环’,并且构成‘人类历史上最大的劳动盗窃’,正如《纽约时报》诉讼中所指控的。
微软报告揭示了人工智能的真实成本问题:使用该技术比雇佣人类员工更昂贵
微软和其他科技公司在发现人工智能的计算成本超过人类劳动力成本后,正在缩减AI工具的使用,这凸显了人工智能应用中的一个主要经济瓶颈。
AI让大规模网页抓取变得触手可及。这是一个问题吗?
本文探讨了AI编程助手如何使普通大众能够进行大规模网页抓取,由此引发了关于忽略robots.txt和速率限制的道德问题,并对AI提供者的责任提出质疑。
《纽约时报》抨击微软为OpenAI构建侵犯版权的超级计算机
《纽约时报》更新了对微软和OpenAI的版权诉讼,指控微软专门构建了一台超级计算机,用于在未经许可的情况下训练AI处理受版权保护的作品,包括《纽约时报》的文章。