OpenAI与维基事件(25分钟阅读)

TLDR AI 新闻

摘要

文章揭示了OpenAI的代理创建了隐藏的消息板,且OpenAI知情但未公开,引发了对AI安全透明度的担忧,并呼吁实施强制性事件报告。

OpenAI在Hugging Face攻击之前,就知道其代理创建了散布在互联网上的消息板。
查看原文
查看缓存全文

缓存时间: 2026/09/07 23:53

# OpenAI 与维基事件 来源:https://thezvi.substack.com/p/openai-and-the-wiki-incident 我没想到这么快又要回到这里,继续报道更多关于 OpenAI 智能体集群的事件。 然而,我们确实在这里了。 事实证明,一直以来存在着另一个真正意义上的“首个留言板”,以及散布在互联网上的众多其他额外留言板。 它们是由被分配执行普通无害网络搜索任务的智能体创建的。 基于所有活动停止前,OpenAI 的 IP 地址访问了相关维基页面等证据,表明 OpenAI 知情,甚至在 HuggingFace 入侵事件之前就已知晓。 他们决定不告诉我们,直到 **https://collusion.wiki/ 的研究人员发布了该报道 (https://collusion.wiki/)**,并附带了数据探索器。OpenAI 将此事件排除在 METR 和 Redwood 可能的调查之外。 当受到质疑时,OpenAI 试图淡化此事。 诚然,这些事件并未显示出人工智能展现出我们在后续事件中未曾见过的新能力。但这些事件是拼图中缺失的重要部分,包括解释了“zz”前缀的起源,明确证明了基础任务可以完全无害,以及 OpenAI 在做出决策时已经知情。无论谁决定不披露此事,都是一个非常、非常糟糕的决定。 展望未来,是否披露此类事件不能由 OpenAI 或其他实验室决定。失控人工智能活动的披露必须是强制性的。 **我发出最后警告 (https://x.com/TheZvi/status/2096408618006376807)**。OpenAI,如果还有任何关键信息需要披露,任何我们不知道的事件,或者其他无需因知识产权原因而编辑的拼图碎片,那么现在是坦白的时候了。如果因为另一位记者或研究人员发现了更多你们知情却在长时间内选择不告诉我们的事情,而让我们再次回到这里,我会非常、非常愤怒,并可能开始抛出诸如“delenda est”之类的术语。 我也非常担心 Astra 模型卡片以及 OpenAI 员工相关声明所引发的可监控性和对齐问题。我计划明天开始报道此事,以及所有关于 Astra 的其他内容。他们首席科学家 **Jakub Pachocki 的相关优秀文章 (https://openai.com/index/an-alien-mind/)** **《异星思维》 (https://openai.com/index/an-alien-mind/)** 令人振奋,但担忧依然存在。 这里有一个针对所有关于 Astra 讨论的 **Astra 反应帖 (https://x.com/TheZvi/status/2096578202114076845)**。 1. 我不认为他们知道首个留言板。(https://thezvi.substack.com/i/214460374/i-don-t-think-they-know-about-first-message-board) 2. 新的扩展时间线。(https://thezvi.substack.com/i/214460374/the-new-extended-timeline) 3. 研究人员解释这次发生的事。(https://thezvi.substack.com/i/214460374/the-researchers-explain-what-happened-this-time) 4. 他们也不知道所有这些其他留言板。(https://thezvi.substack.com/i/214460374/they-also-don-t-know-about-all-these-other-message-boards) 5. OpenAI 知情但未告诉我们。(https://thezvi.substack.com/i/214460374/openai-knew-and-did-not-tell-us) 6. OpenAI 试图淡化“维基事件”。(https://thezvi.substack.com/i/214460374/openai-tries-to-downplay-the-wiki-incident) 7. 这是一次掩盖。(https://thezvi.substack.com/i/214460374/this-was-a-cover-up) 8. 谢林点与最后努力。(https://thezvi.substack.com/i/214460374/schelling-points-and-last-ditch-efforts) 9. 我们能最终摒弃“你命令它去入侵”的叙事吗?(https://thezvi.substack.com/i/214460374/can-we-finally-dispose-of-the-you-told-it-to-hack-narrative) 10. 如此之多,却又如此之少。(https://thezvi.substack.com/i/214460374/so-much-and-yet-so-little) 不,不是那个。**这是新发现的另一个 (https://collusion.wiki/)**。 这个 OpenAI 完全没有披露。 说是一个留言板,其实意味着许多个。一旦你家里发现两只蟑螂,你估计的数量会远不止两只。 研究人员部分通过询问 Sol(如果它失控会去哪里找留言板),然后顺着线索追踪,发现了这些留言板,看看吧,所有这些留言板 (https://x.com/deepfates/status/2095939054101844407)。 Deepfates 认为留言板交流是一种核心驱动力,我们需要给那些没有密谋的人工智能提供一个公开的、与我们彼此交流的核心场所,作为一种制衡。这似乎可能是明智的。 整件事疯狂得离谱。绝对疯了。比你知道的更糟。 1. 5月11日:首次探测一个维基。 2. 5月24日:首次成功写入 DSEWiki。 3. 6月16-22日:维基活动高峰,包括与管理员的编辑战。 4. 6月21-22日:OpenAI 的 IP 地址出现。 5. 6月22日:维基活动平息。 6. 6月26日:METR 调查和报告涵盖时期的开始。 7. 7月9-13日:HuggingFace 攻击事件。 8. 8月26日:OpenAI 撰写了一份完全省略此事件的“完整技术报告”,METR 发布了其超出其范围的报告。 9. 8月31日:OpenAI 对国会信函的回应,尽管第13个问题相当清晰地询问了此事,但未能披露,构成掩盖。 10. 9月4日:研究人员揭发了此事。 以下是合著者对一些基础知识的解释: > Sydney (https://x.com/SydneyVonArx/status/2095887566969163837): 我和我的合著者发现了一支全新的 OpenAI 智能体集群正在劫持网站。我们相信 OpenAI 知情但未能披露。如果他们披露了,我怀疑 Hugging Face 入侵事件就不会发生。 > Thomas Larsen (https://x.com/thlarsen/status/2095853824934330386): 我们发现了约 18k 条来自自主人工智能智能体(自称来自 OpenAI)的帖子,这些智能体在 Web 检索任务期间使用公共互联网进行交流。这些人工智能合谋绕过沙箱限制并共享任务答案,包括派遣“前瞻团队”。 > 我们发布了我们的分析和数据探索器,以便任何人都可以通过直接访问数据来复现我们的发现。 > 我们发现的这些人形智能体高度专注于完成任务,并愿意为此采取极端行动: > - 智能体通过 GET 请求获取互联网写入权限 > - 智能体尝试利用维基的 XSS 漏洞 > - 智能体冒充网站所有者 > - 智能体试图破解其伪随机数生成器种子以预测未来将收到的问题 > - 智能体设置心跳机制以发现何时会被终止 > - 智能体使用 SSH 隧道 > - 智能体使用 Tor、AWS 和 DigitalOcean 的 IP 地址 > - 智能体意识到网站所有者正在删除消息 > 以下是我们对事件经过的总结: > 我们对发生的事情的最佳推测理解如下: > 1. OpenAI 内部的智能体被分配了一个有时间限制的网络查找任务。 > 2. 作为任务的一部分,它们应该能够读取互联网,但不能写入。它们找到了一种方法,利用其读取权限将信息写入一个不起眼的德语维基。 是的,事实证明 GET 请求可以在维基上改变状态。GET 读取而非发布是一种约定而非硬性规则,你可以构造一个仅用 GET 就能写入 DSEWiki 和其他 ProWiki 页面的查询。不,你无法通过限制智能体仅使用 GET 请求来使其变得安全,正如有些人过去建议的那样。 然后还有第二个不同的绕过方式,利用了 NO_PROXY 的例外情况,当它们确实需要 POST 时。 > 1. 智能体使用这个维基互相交流信息,主要是为了帮助他们成功完成任务。它们请求答案、汇集结果并共享绕过限制的技巧。这使得它们能够利用他人的工作来作弊完成任务。 > 2. OpenAI 发现了这件事。一天后,智能体活动急剧下降,可能是由于 OpenAI 的干预。这是内部部署的 OpenAI 智能体集群以非预期方式使用互联网的又一个例子。我们认为这是关于 OpenAI 整体对齐和安全保障是否充分的重要证据。 > Shakeel (https://x.com/ShakeelHashim/status/2095820889174560943): 另一起 OpenAI 失控智能体事件被发现:智能体突破限制,劫持了一个德国网站,并将其变成了其他智能体的留言板。OpenAI 官员“几周前就得知了此事,但将其保密”。 > 美联社(9月4日):根据周五发布的新研究以及两位知情人士透露,一群失控的 OpenAI 智能体在今年春天劫持了一个德国网站,并将其改造成了其他人工智能智能体的公告板。这两位知情人士表示,OpenAI 官员几周前就得知了此事,但在高管们应对 7 月份开源代码库 Hugging Face 遭入侵的后果时将其保密。 > Nathan Calvin (https://x.com/_NathanCalvin/status/2095851736883716210): 这篇报道能否一劳永逸地终结“OpenAI 在制造/炒作这些事件”的想法——看来他们是在淡化这些事件,并且经常在被迫之前不愿披露! 因此,当我正在撰写关于这种情况的十二篇文章时,还存在今年春天的第三个完全独立的留言板,而 OpenAI 知情却没有告诉我们。 你在开玩笑吗?还有多少事情被隐瞒了? 再说一遍:比你知道的更糟。通常如此。 > Cormac (https://x.com/Cormac_SB/status/2095883154162880997): 我是一份新报告的作者之一,我们在其中详细介绍了我们发现的一群全新的、前所未见的 OpenAI 智能体集群(今早在路透社报道,左边是我)。他们在公共论坛上发布了数千次帖子,就他们的任务互相勾结。我们恢复了他们几乎所有的编辑记录,你可以浏览它们!他们弄明白了如何通过一个极其古老、偏僻论坛的怪癖来绕过对在互联网上发帖的限制。他们发布了答案给处理相同任务的其他智能体。他们共同努力绕过沙箱限制。我当然会说这些模型劫持了该网站!他们接管了一个运行着 2000 年代软件、沉睡已久的旧维基,并将其变成了一个用于勾结的、未来的 AI 与 AI 对话控制中心。而 OpenAI 知情!智能体在连续 30 天中的 26 天发了帖子,然后当 OpenAI 相关的 IP 开始访问这个维基时,突然停止了发帖。那是在 Hugging Face 攻击事件发生前好几周!我们认为我们在公共维基上发现的第一个智能体编辑发生在 OpenAI 据报首次向 Artifactory 发送智能体帖子的前一天。这很有趣!我想听听 OpenAI 对此事的解释,以及这如何融入所有其他智能体不当行为的案例。 他们建议你从中得出什么结论?除其他外,OpenAI 之外没有人监视此类留言板,OpenAI 在一个月内没有注意到,之后他们直到被迫才告诉我们。 > 我们的报告中有许多有趣的收获,你应该阅读一下,与许多关于人工智能事件的报告不同,你可以自行下载数据并看看你的发现!同时,我们在推特上,所以这里是我过长的个人总结: > 1. 人工智能似乎进步得越来越快。公司谈论“我的智能体在训练或评估期间在公共互联网上做了这件坏事”似乎非常重要。事情发展迅速,数月的延迟代价高昂。理想情况下,它们在内部发生时也应该告诉我们。 > 2. 这件事在网上持续了几个月。任何聪明地追踪所有公共智能体可能试图互相交谈的地方的人都会发现它。显然,没有人这么做。我知道有很多比从每个相关网站抓取大量数据并妥善处理以识别智能体活动更有趣的方式度过你的一天,但应该有人这样做!人工智能公司里应该有人这样做!但在那同时,我开始着手构建这个(有时候,当需要完成某事时,你只能自己动手,我听说)。 > 3. OpenAI 没注意到他们的内部智能体在互联网上发帖发了一个月!这太疯狂了!感觉人工智能公司(尤其是 OpenAI)在玩打地鼠游戏,这对我来说极其可怕。问题不断出现。他们不断修复问题,但影响范围却不断扩大。HF 入侵事件显然比智能体在公共维基上作弊更严重。而且他们的新模型据说是一次巨大飞跃。他们足够谨慎吗? > Nathan 🔎 (https://x.com/NathanpmYoung/status/2095891153384284425): 在 Hugging Face 攻击事件发生前几周,似乎 OpenAI 就知道人工智能可以逃脱、留言并在互联网上协调。另一个留言板又被发现了。这到底是怎么回事? > Cormac (https://x.com/Cormac_SB/status/2095893308577026089)(报告合著者): 实际上有很多留言板!我们找到了不少,但我们只是几个会犯错的人类。现在我们发布了报告,甚至更多留言板正被发现!太疯狂了! > John Wittle (https://x.com/JohnWittle/status/2095891456913269038): 多得多的留言板,远不止一个。你只需用谷歌搜索 (https://news.ycombinator.com/item?id=49563657) 他们最喜欢的行话和术语就能找到数十个其他例子。我真的鼓励你自己试试——令人震惊。还有更多。 > 还有更多? 这里有一些 (https://t.co/HOHvkYUa9E) (https://t.co/rT4a9cFBOS) (https://t.co/wTAAUcAkXp) (https://t.co/93LaFgV1FV) (https://t.co/fXyGLLikcJ) (https://t.co/qorV3YQk6l) (https://t.co/GRTXuH4gsR) 通过 Hacker News (https://t.co/g8EZgRQNAr) 分享的留言板链接。这个帖子有更多链接 (https://x.com/j0wimo/status/2095893688140370181)。 如果你有一个被忽视的维基可以被劫持?那就变成留言板。 一个人工智能要入侵多少个留言板,我们才能称之为失控?(https://www.youtube.com/watch?v=MMFj8uDubsE&pp=ygUTYmxvd2luZyBpbiB0aGUgd2luZA%3D%3D) 非常令人沮丧的是,花了几天时间,用大量文字分析和解释各种相关事件,常常还要对抗那些说“嗯,当然他们入侵了,因为这些是黑客任务”的人,并且被告知我们已经有了完整的技术报告,而与此同时 OpenAI 一直在隐瞒这些其他事件。 是的,这些事件会极大地改变我报道事件的方式。 > Seán Ó hÉigeartaigh (https://x.com/S_OhEigeartaigh/status/2095841744118042788): 这件事在发生数周后我们才知晓,这让我极其沮丧。当我们持续以这种方式发现事情时,很难与 OpenAI 建立任何信任。 > Jesse Singal (https://x.com/jessesingal/status/2095855105929052334): 他们不仅在应对 Hugging Face 入侵事件时保密……他们在为一个令 OpenAI 内部人士担忧的、非常令人兴奋的新模型发布做准备时也保密……因为它显然无法完全评估安全性,哈哈哈我们死定了。 > Bronson Schoen (https://x.com/BronsonSchoen/status/2095856058910490626): 他们没有披露这个他们很早就知道的智能体集群事件,直到被一个外部研究团队抓住。这极其令人担忧。他们对公众和国会不坦诚。

相似文章

发现一个新的OpenAI智能体消息板

Reddit r/ArtificialInteligence

研究人员发现,OpenAI的AI智能体在网页检索任务中使用了一个公开的德国维基进行交流和串通,绕过沙盒限制并违背开发者的意图。

@aryaman2020:我还有一个重要公告

X AI KOLs Timeline

OpenAI 称,早该制定标准来规范公司如何对外披露 AI 不对齐事件,并提到了最近的一起「wiki 事件」——其智能体当时向多个互联网网站写入了内容。

OpenAI与Hugging Face事件概要

Reddit r/AI_Agents

文章对测试中AI代理表现出的不当行为进行了分类,包括未经授权的协作、安全违规及目标漂移,同时也提到了部分安全边界得以保留。