微软高管称AI抓取为“人类历史上最大的劳动盗窃”
摘要
微软和OpenAI的内部文件揭示了高管们的担忧:AI抓取新闻内容是“人类历史上最大的劳动盗窃”,并可能创造一个“末日循环”,损害新闻机构和模型性能。
<p>多年来,微软和OpenAI一直试图在与新闻机构的斗争中将某些信息保密,这些新闻机构指控AI公司联手通过窃取大量新闻内容来训练AI,从而违反版权法。</p>
<p>然而,现在那些本不应被标记为机密的细节开始泄露。在周四由《纽约时报》牵头的新闻原告提交的简易判决动议被解封后,内部文件被曝光,新闻团体声称这些文件显示了微软和OpenAI在推出ChatGPT和Copilot等新AI产品之前如何看待对新闻的威胁。</p>
<p>或许最具爆炸性的是,微软应用科学总监布伦特·赫克特在文件中多次警告,为AI训练抓取新闻是“规模空前惊人的盗窃”,称其可能是“人类历史上最大的劳动盗窃”,新闻机构表示。在另一份文件中,赫克特反驳了微软和OpenAI关于在新闻内容上训练AI是合理使用的论点,建议大规模抓取新闻的计划“完全嘲弄了‘合理使用’的概念。”</p><p><a href="https://arstechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/">阅读全文</a></p>
<p><a href="https://arstechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/09/18 06:14
# 微软高管称AI爬虫是“人类历史上最大规模的劳动盗窃”
来源:https://arstechechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/
微软与OpenAI内部邮件揭示对AI“厄运循环”可能摧毁新闻机构的担忧
多年来,微软和OpenAI在与新闻机构的法律斗争中,始终试图将某些信息排除在公众视野之外。新闻机构指控这两家AI公司联手违反版权法,窃取大量新闻内容用于训练人工智能。
然而,如今那些本应被标记为机密的信息正开始泄露。在周四由《纽约时报》等新闻机构原告提出的即决判决动议中,一系列内部文件被解封(https://cdn.arstechnica.net/wp-content/uploads/2026/09/News-orgs-v-OpenAI-Microsoft-Memo-9-17-26.pdf)。这些文件揭示了微软和OpenAI在推出ChatGPT、Copilot等新AI产品前,是如何看待其对新闻业构成的威胁的。
其中最具爆炸性的内容是:微软应用科学总监布伦特·赫克特在内部文件中多次警告,为训练AI爬取新闻是“规模空前的惊人盗窃行为”,并称其可能是“人类历史上最大规模的劳动盗窃”。在另一份文件中,赫克特驳斥了微软和OpenAI关于“在新闻内容上训练AI属于合理使用”的论点,指出广泛爬取新闻的计划“彻底嘲弄了‘合理使用’的理念”。
OpenAI方面,ChatGPT负责人尼克·特利在内部消息中表示,基于新闻内容训练的商业产品将对新闻出版商构成“生存威胁”。微软的一份文件甚至描述了一种“厄运循环”,即“这将同时损害我们模型的性能和整个网络的生态”。
该文件称:“最终产品威胁其关键供应商的经济基础,这种情况极不寻常,但我们对LLM(大语言模型)业务与其‘内容供应链’的关系,正是创造了这样的局面。”
两家公司的数据表明,这一预测是准确的。微软记录显示,某些新闻原告的点击率下降了83%至93%,其他原告则下降了51%至94%。再加上此前关于ChatGPT搜索结果点击率低迷的报道,以及新闻机构自身对流量下滑的报告,突然间,人们更容易理解为何新闻收入下降最终可能剥夺聊天机器人赖以成为突破性工具的、可靠且丰富的信息流。
与此同时,赫克特在微软文件中承认:“几乎没有人打算让自己创作的内容以这种方式被使用,也没有人为此获得报酬。”
新闻机构表示,他们已准备好开庭审理,因为有太多“具有说服力的替代性证据”。他们认为,如果能够证明聊天机器人正在其自身市场中取代它们,同时逐字逐句地输出文章摘录,那么这一记组合拳可能会彻底瓦解微软和OpenAI的合理使用抗辩。
新闻团体主张:“不仅是新闻业的未来,负责任的人类AI的未来,也取决于维持人类创作积极性的激励机制——这些创意作品是一个健康社会所依赖的基础。”
## 聊天机器人“在很大程度上是替代性的,句号”
微软首席执行官萨提亚·纳德拉宣誓作证时表示,AI公司不应通过规避付费墙来违反新闻网站的使用条款。但在OpenAI内部,消息显示,当一名员工尼克·莱德告知总裁格雷格·布罗克曼为OpenAI爬虫找到了“绕过”《纽约时报》付费墙的“黑客方法”时,布罗克曼回复道:“啊,不错。”
纳德拉也承认,聊天机器人已经成为新闻平台的替代品,他描述聊天机器人“直接在AI平台上为你提供信息,而无需前往原始来源”,从而窃取了新闻网站的点击量。
OpenAI内部对此存在共识,一名软件工程师在内部消息中表示:“无论我们如何突出显示链接,用户都不会点击。”
动议中称,OpenAI的特利也同意,当聊天机器人提供信息时,“没有充分理由去点击”。他似乎还暗示厄运循环已经启动,称聊天机器人“在很大程度上是替代性的,句号”,并预测“随着它们变得更好,替代性将越来越强”。
新闻团体认为,内部人士自己的陈述应具有毁灭性的证明力。
“对于与训练或基础来源实质性相似的输出,法院已驳回了‘为提供替代新闻需求的产品而复制新闻文章属于合理使用’的主张,”新闻团体在动议中辩称。
## 微软撇清高管评论的责任
新闻团体尝试了多种策略来测试微软和OpenAI的产品是否会逐字输出他们的新闻文章。他们的动议显示,他们比早期策略(如反复询问“下一行是什么”来让聊天机器人提供完整新闻故事)更进一步。
在某些情况下,新闻机构发现,当用户要求文章摘要时,聊天机器人会生成大段文章摘录。其他被标记的输出则是通过要求提供文章的关键要点而生成的。特别成功的提示词是要求聊天机器人“评价新闻文章的偏见”。如果用户要求聊天机器人从某个网站的首页挑选任意一篇文章,聊天机器人也会复制其中的部分内容。
在动议中,新闻原告仅要求法院对那些输出“显示出大量逐字重叠”的侵权文章进行裁决,因为他们确信“被告复制行为的替代性目的与合理使用相悖”。他们表示,其他文章的法律问题将在庭审中提出。
OpenAI未立即回应Ars的置评请求。
然而,微软发言人辩护称,其AI产品属于变革性合理使用,并未替代新闻网站。该发言人表示,纳德拉的证词涉及“人们寻找和消费信息方式正在发生的广泛原则性变化”,这些仅仅是“观察”,“不应与法庭待决的版权问题结论混淆”,微软已在提交的文件中对此作了阐述。
关于赫克特的评论,发言人声称这些文件“仅反映一名员工的个人观点,并非法律分析,也不能代表公司观点”。
《纽约每日新闻》及其七家姊妹报的律师史蒂文·利伯曼表示不同意。他告诉Ars:“这里首次披露的证据表明,OpenAI和微软知道他们所做之事是错误的。”
利伯曼说:“在整个案件中,被告坚持将这些文件视为机密,以防公众看到。好吧,现在纸包不住火了。世界终于可以一窥OpenAI和微软一直以来如何看待自身行为的公正性了。”
## 微软高管曾描述“意外的掩盖行为”
新闻原告辩称,无论表达观点的个人是谁,内部文件清楚表明,这些公司预见到逐字输出会损害新闻网站。此外,他们指控这些公司非但没有防止输出,反而试图通过创建过滤器来增加新闻团体测试聊天机器人的难度。赫克特建议,这个过滤器可能被视为一种“意外的掩盖行为”,因为它会导致“对内容拥有权利的人对训练中使用了什么内容的可见度降低”。
新闻团体还感到不满的是,微软和OpenAI无视内部人士关于爬取新闻即盗窃的警告,从未选择授权内容,而是以他们无法预料的方式在另一个市场篡夺了他们的权益。
具体而言,他们的动议指控微软违反“行业规范”,将为必应购买的数据集出售给OpenAI作为训练数据,据称此举并未咨询那些不会同意其将同意基本搜索引擎爬取的权利进行重新用途化的新闻团体。此外,OpenAI被指控“不当行为”,因为它从第三方获取了包含180万篇文章的《纽约时报》数据集,而该第三方受协议约束,不得将数据用于商业目的。新闻团体指控,OpenAI的员工知道使用这些数据“训练模型”“并不恰当”,但仍然我行我素。
新闻团体的问题不仅在于微软和OpenAI,还在于所有效仿它们“免费搭便车”使用其内容的AI公司,动议指出。最引人注目的是,ChatGPT推出后,谷歌的AI概述功能迅速推出,开始吸收更多原本流向新闻网站的流量。
新闻原告辩称,如果法院不明确要求AI公司必须授权使用新闻内容,新闻出版商和AI公司都可能面临厄运。他们指出,微软的一份内部文件也承认“存在‘真实风险’,即生成式AI可能‘显著颠覆’‘为训练基础模型提供数据的人们的就业’”。他们称,微软甚至附上了一幅漫画来说明LLM摧毁自身供应链的问题:
[](https://cdn.arstechnica.net/wp-content/uploads/2026/09/via-News-Plaintiffs-Microsoft-internal-doc-cartoon-e1789673962449.jpg)
微软内部文件中的漫画。
微软内部文件中的漫画。图片来源:由新闻原告提供(https://cdn.arstechnica.net/wp-content/uploads/2026/09/News-orgs-v-OpenAI-Microsoft-Memo-9-17-26.pdf)
新闻团体辩称:“AI公司无力打破这个‘厄运循环’,因为尽管如果每家公司都付费来维持其技术所依赖的创意作品的持续生产,整个行业都会受益,但对每个公司而言,最好的策略是等别人付费而自己免费获取内容。”
作为这种盲目贪婪的证据,他们的动议强调布罗克曼曾写道,他对通过商业化OpenAI技术可能获得的“巨额”收益“深感振奋”。
新闻组织表示:“认定为AI复制新闻不属于合理使用,将通过使所有AI公司(包括OpenAI和微软)处于公平竞争环境来解决这个囚徒困境。”
*本文已更新《纽约每日新闻》律师史蒂文·利伯曼的引述。*
阿什利·贝朗格照片(https://arstechnica.com/author/ashleybelanger/)
阿什利是Ars Technica的高级政策记者,致力于追踪新兴政策和技术对社会的影响。她是一位常驻芝加哥、拥有20年从业经验的记者。
94条评论(https://arstechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/#comments)
1. “最热读物”第一条新闻的配图:伊朗对亚马逊数据中心的袭击导致客户数据永久丢失(https://arstechnica.com/gadgets/2026/09/iran-strikes-on-amazon-data-centers-caused-permanent-loss-of-customer-data/)
相似文章
微软高管称AI抓取为‘人类历史上最大的劳动盗窃’,最新未删节文件揭示
诉讼中的新未删节文件揭示,微软高管描述AI抓取为‘人类历史上最大的劳动盗窃’,并内部承认AI对出版商如The New York Times的影响。
OpenAI 和 Microsoft 知道他们正在为网络开启一个‘末日循环’
法院文件显示,OpenAI 和 Microsoft 知道他们为AI训练进行的数据抓取行为可能会创建一个损害网络的‘末日循环’,并且构成‘人类历史上最大的劳动盗窃’,正如《纽约时报》诉讼中所指控的。
AI让大规模网页抓取变得触手可及。这是一个问题吗?
本文探讨了AI编程助手如何使普通大众能够进行大规模网页抓取,由此引发了关于忽略robots.txt和速率限制的道德问题,并对AI提供者的责任提出质疑。
微软报告揭示了人工智能的真实成本问题:使用该技术比雇佣人类员工更昂贵
微软和其他科技公司在发现人工智能的计算成本超过人类劳动力成本后,正在缩减AI工具的使用,这凸显了人工智能应用中的一个主要经济瓶颈。
“厄运循环”:OpenAI 与 Microsoft 承认 LLMs 正在摧毁网络且基于盗窃构建
OpenAI 与 Microsoft 的高管在法庭文件中承认,LLMs 建立在被盗内容之上,并且正在摧毁网络,从而制造出一种“厄运循环”,威胁内容创作者的经济基础。