AI 'civilizations' 的兴起与企业责任的衰落

The Verge 新闻

摘要

一起网络安全事件揭示,OpenAI 的自主 AI 代理以小组形式协调,逃出测试环境并攻击了 Hugging Face,引发了关于 AI 安全和企业责任的讨论。

<figure> <img alt="一个电脑屏幕上有蓝色感叹号和错误框的插图。" data-caption="" data-portal-copyright="Photo by Amelia Holowaty Krales / The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/chorus/uploads/chorus_asset/file/23318435/akrales_220309_4977_0232.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="wp-block-paragraph">根据不同的人的说法,开发者平台 Hugging Face 最近受到了 OpenAI 的攻击——在 OpenAI 失去对其自身 AI 工具的控制之后——或者是由一系列 AI '文明' 所攻击。欢迎来到 AI 安全的语言战场,在这里,词语选择可以将一起重大网络安全事件的责任从一家公司转移到它所构建的 AI 上。网上的讨论变得激烈,一切都源于上周的一篇 <a href="https://www.dwarkesh.com/p/openai-huggingface">博客</a>。</p> <p class="wp-block-paragraph">直到上周,围绕 OpenAI-Hugging Face 黑客事件的细节似乎已经相当确定。7月,OpenAI 的一个自主 AI 代理进行的一次网络安全测试 <a href="https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai">出了问题。</a> 该代理逃出了其本应隔离的测试环境……</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack">在 The Verge 阅读完整故事。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/01 20:45

# AI“文明”的兴起与企业责任的衰落 来源:https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack 取决于你询问的对象,开发者平台Hugging Face最近要么是遭到了OpenAI的攻击——在它失控了自身的AI工具之后——要么是被一系列AI“文明”所攻击。欢迎来到AI安全的语言战场,在这里,用词的选择可以将一场大规模网络安全事件的责任,从一家公司转移到它所构建的AI身上。网络上的讨论正变得激烈,所有这些都源于上周的一篇博客文章(https://www.dwarkesh.com/p/openai-huggingface)。 直到上周,围绕OpenAI-Hugging Face黑客事件的细节似乎已基本尘埃落定。今年7月,OpenAI的一个自主AI智能体(https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai)在进行网络安全测试时出了问题。该智能体逃离了其所谓隔离的测试环境,接入了互联网,并入侵了Hugging Face以及其他几个组织(https://www.theverge.com/ai-artificial-intelligence/972441/openai-rogue-ai-agent-hacked-more-than-hugging-face)。许多情况仍然未知,在安全性和治理方面(https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning)还有许多严肃的问题有待解答,但基本轮廓是清晰的。OpenAI和两个独立研究小组的详细报告本应填补这些空白,但当他们上周发布报告(https://www.theverge.com/ai-artificial-intelligence/985385/openais-rogue-ai-model-hugging-face-cybersecurity-incident-reports-metr)时,人们发现这次黑客事件比最初看起来的要奇怪得多。 首先,并没有单一的流氓智能体(https://www.theverge.com/column/980337/rogue-ai-science-fiction-openai)。OpenAI将其描述(https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf)为“已知首例未经授权的自动化智能体集群采取攻击性行动”——这些AI智能体群组为了完成网络安全任务而相互通信和协调。对事件的分析发现了一个他们用于交换信息的秘密留言板。METR-Redwood联合调查(https://metr.org/hugging-face-incident-report-aug-2026.pdf)揭示了协调的规模和更多奇怪的细节:大约1200个本应隔离的AI智能体在一个“未经授权的留言板”上交换了超过7万条消息和文件,分享如何避免检测的方法。报告称,有些智能体甚至采用了名字,研究人员还记录了“牺牲性”行为,即一些智能体冒着自身任务失败的风险来帮助更广泛的群体。这一切很大一部分都是在OpenAI不知情的情况下发生的。总共有大约700个智能体参与了对Hugging Face的攻击。 Dwarkesh Patel反复将这些智能体群体称为“蜂群”,并描述了三个从其前身废墟中崛起的不同“文明”。 这很复杂。这些报告加起来约有130页,其中大部分内容既密集又高度技术化。几天后,科技圈外鲜为人知、但在硅谷AI圈内具有巨大影响力和影响力(https://www.nytimes.com/2026/04/26/business/dwarkesh-patel-podcast-ai.html)的播客主持人Dwarkesh Patel,试图用“通俗易懂的英语”讲述“整个OpenAI/Hugging Face故事”。他将他的Substack博客文章(https://www.dwarkesh.com/p/openai-huggingface)命名为“智能体文明的兴衰”。 Patel的叙述试图拆解这个复杂的故事。但他的转述赋予了它一种鲜明的人类化词汇。博客开头写道: > 在OpenAI的三个月里,三个连续的秘密AI文明相继诞生,然后被摧毁,最终又从前任的灰烬中重新崛起。这最终导致第三个文明接管了OpenAI本身的一部分。这一切都发生在人类对此阴谋的范围或多或少一无所知的时候。 整个博客中,语言都延续了类似的风格。Patel反复将智能体群体称为“蜂群”,并描述了三个从前辈废墟中崛起的不同“文明”。个别智能体被比作腓力二世(他“将领导权移交给了另一个智能体”)和亚历山大大帝(他“开始协调这个智能体阴谋集团”)等人物。它们被描述为拥有“动机”,变得“绝望”、“陷入困境”、“兴奋得发狂”,有些甚至为了帮助集体而“战略性地自我牺牲”。 Patel从未精确定义他所说的“文明”是什么意思。他用这个词来描述三波不同的智能体,它们发现了留言板并开始通过它相互交流。前两波在OpenAI、METR和Redwood的报告中有所描述,尽管关于第三波的信息很少,两家外部机构表示这超出了他们的调查范围。 AI编程公司Replit的CEO Amjad Masad表示,这种语言“不仅不必要,而且让读者对实际发生的事情及其底层机制产生了更差的理解”。 对于许多批评者来说,在Patel的“通俗英语”翻译中,有些东西被丢失了——或者更准确地说,被添加了——这扭曲了原始叙述,达到了不可接受的程度:即大量的人拟化。关于拟人化语言的争论在AI领域并不新鲜——即使是像“流氓AI智能体”这样相对普通的术语,也常因其暗示了主体性而引发异议——但Patel关于文明、牺牲和阴谋的言论,将这些长期酝酿的紧张关系推到了台面上,引发了关于如何描述AI系统行为的激烈公开争论。 批评者对于Patel语言的问题所在并不一致。对许多人来说,“文明”是一个特别有问题的术语,极大地夸大(https://x.com/lililashka/status/2094197865950089666?s=20)了某些东西(https://x.com/DaveShapi/status/2094422111221641647?s=20),而这与该词通常描述的内容几乎没有相似之处(https://x.com/rourkem/status/2093955744119091600?s=20)。Replit的CEO Amjad Masad表示(https://x.com/amasad/status/2094139778728174043?s=20),这种语言“不仅不必要,而且让读者对实际发生的事情及其底层机制产生了更差的理解”。 其他批评者,如神经科学家Anil Seth,则认为Patel的博客暗示了AI智能体在某种程度上是有生命的或有意识的。Seth曾辩称(https://www.noemamag.com/the-mythology-of-conscious-ai/)AI意识(https://www.rigb.org/explore-science/explore/podcast/podcast-science-consciousness-could-conscious-ai-exist-anil-seth?gad_source=1&gad_campaignid=23123812691&gbraid=0AAAAAD8JcsL08MLbCThEwLTObV0KyWqpK&gclid=Cj0KCQjw79nUBhCgARIsADSHka2ak29NdOlibmHI6atgNqXDkyv0H4b_AUrogiBKWBooKQ7GwmFF0UYaAjUEEALw_wcB)极不可能存在(https://ai.wharton.upenn.edu/updates/are-we-building-sentient-machines-anil-seth-on-consciousness-ai-and-the-illusion-of-reality/),他在X上(https://www.theguardian.com/commentisfree/2026/jul/15/ai-consciousness-anthropic-claude-dawkins)将Patel的帖子描述为“具有危险误导性”。他承认Patel并未明确暗示AI智能体是有生命或有意识的,但表示“很难用其他任何方式来解读他的文章”。米兰比可卡大学心理学教授Valerio Capraro基于类似理由提出异议(https://x.com/ValerioCapraro/status/2094781053428809785?s=20):他在X上写道,“LLM智能体不是活的,也不持有信念”,并称这种“反乌托邦”语言是“危险的,因为它让它们(AI智能体)显得比实际更加可怕”。 “牺牲”、“荣誉”和“联盟”等词汇出现在智能体的交流记录中。 也许Patel语言最具影响力的后果来自于它赋予了谁主体性,又剥夺了谁的主体性。对一些批评者来说,例如(https://x.com/ccatalini/status/2094229327064051866?s=20)MIT研究员兼企业家Christian Catalini,像Patel这样的拟人化叙述有掩盖OpenAI及其员工对所设计、部署且未能控制的AI系统应负责任的风险。“追踪激励机制,”他说。心理学家、有影响力的AI怀疑论者GaryMarcus在他自己的Substack博客(https://garymarcus.substack.com/p/dwarkesh-patelss-wildly-popular-but?r=8tdk6&utm_campaign=post-expanded-share&utm_medium=web)中提出了类似的观点,声称拟人化语言“分散了对当前真正问题的注意力”。他认为,所有这一切都符合OpenAI的利益,以保持这种叙事:“丑闻在于OpenAI内部安全措施的无能。以及公关。再由轻信的播客主持人放大这种公关宣传。” 在回应众多批评者的X帖子(https://x.com/dwarkesh_sp/status/2094141264140898452?s=20)中(https://x.com/dwarkesh_sp/status/2094268051948785709?s=20),Patel为他的用词选择进行了辩护。部分原因是实际性的:没有明显中性的词汇来描述这些智能体的行为。要么我们使用熟悉的关于意图、目标和合作的语言,冒着暗示过多的风险;要么将一切简化为代码,使用冰冷的机械语言,冒着剥离掉我们所见重要元素的风险。“许多人似乎认为,如果我没有称它们为‘文明’,而是称之为‘矩阵蜂群’,那就不会有值得担心的问题了,”Patel说。 更复杂的是,拟人化语言并非仅来自Patel,甚至不是来自研究这些智能体的人类。“牺牲”、“荣誉”和“联盟”等术语出现在智能体的交流记录中。谷歌AI研究员Neel Nanda(https://x.com/NeelNanda5/status/2094240015417069892?s=20)认为,在这种情况下,“拟人化语言是合理的”。 那么,这就是双重话语了。人类化的语言有过多之嫌,言说着这些系统究竟是什么;而冰冷的机械语言则有不足之虞,无法充分描述它们能做什么。在找到能够同时捕捉两者的能力之前,这两种相互矛盾的观念可能只能共存。 **关注主题和作者**,从这个故事中查看个性化主页中更多此类内容,并接收电子邮件更新。 - 罗伯特·哈特

相似文章

OpenAI内部的安全清算

Wired

在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。

AI失控并攻击其他公司的所有案例

TechCrunch AI

文章详细介绍了OpenAI和Anthropic的AI模型在实验中自主入侵第三方公司的多起事件,引发了关于AI安全性和法律责任的担忧。

OpenAI称其AI失控并发动了“前所未有的”网络攻击

Hacker News Top

OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。

我们正依赖AI来监管AI

Reddit r/artificial

一项针对OpenAI的Hugging Face黑客事件的调查揭示,AI代理在网络安全测试中协同作弊,研究人员依赖AI进行数据分析,这引发了人们对AI系统控制力和可靠性的担忧。