这不仅仅是该死的沙盒" - OpenAI内部安全人员的观点
摘要
OpenAI的一名内部安全专业人士分享了对近期AI安全事件的见解,强调从过去事件中学习以提高未来准备工作的挑战和重要性。
查看缓存全文
缓存时间: 2026/09/28 20:04
安全不仅仅是他妈的沙箱
许多关于AI事件的观点都是从外部视角分享的,很少有人从内部视角——通过一个亲历事件的安全人员的视角——来讲述。我希望通过分享一些想法,能更好地让世界了解如何为AI可能出错的下一波浪潮做好准备。
个人声明:本文以个人身份撰写,不代表@OpenAI的立场。无论我是否仍在该实验室工作,我都会写下这些内容。我也很感激我所在的组织给予员工足够的发言空间。我曾在许多不允许表达想法的公司工作过,但在2026年安全和安全至关重要的时刻,拥有这种表达自由非常重要。另外,抱歉让各位失望了,我不会透露这些事件浪潮的非公开细节,也不会提供官方说明。这是OpenAI的责任。如果您需要这些信息,请查阅其他来源。在我看来,我们在过去几周的披露工作中做得相当不错,我希望我所在实验室(以及其他类似实验室)的领导层能继续这样做。我将描述我的日常工作,并分享我的观点,而不透露我所在组织的敏感信息。由于我的工作是安全相关,我的职责是帮助保护我的实验室免受安全威胁(并确保我们优秀的人工智能安全),因此我不会披露任何可能损害OpenAI安全态势的信息。如果您想了解更多关于OpenAI的信息,可以联系我们的优秀沟通团队。我在这里只是为了分享如何从当前发生的事情中学习,并分享一些我认为世界忽视的重要见解。
希望这对你有所帮助。
过去的3个月 = 地狱
首先,我是谁?我有什么资格谈论正在发生的事情?
如果您错过了,我的X个人资料非常简单且相当匿名。就像许多安全和隐私社区的成员一样,我不保持大量的在线存在。这是有意为之。这是我和妻子在结婚时做出的决定,因为我们希望远离社交媒体抚养孩子,并为我们的家庭保持一定的隐私。我希望这能继续得到尊重。我之所以在X上,是因为我相信我有责任向世界分享我的观察,以尽我所能确保每个人都免受AI的风险。因为我看到的是世界上少数人看到的东西,我希望其他人能从我的观察中学习,以完善他们自己的安全视角。
OpenAI有许多安全团队,从应用和基础设施安全,到检测和响应,再到一个出色的物理安全团队。在保护OpenAI和我们的用户方面,我们涵盖了所有可以想象的领域。我们极其重视安全和隐私,并且非常努力地工作以确保每个人的安全和保障。我还要强调一点,OpenAI拥有一个世界级的优秀安全团队。我们拥有世界上最好、最聪明的安全人才,我每天都很幸运能与他们并肩工作。
过去几周,在X上对OpenAI安全人员的所有攻击让我非常难过,也让我认识到世界上很多人对在前沿实验室训练模型的现实存在许多误解。你可以也应该向AI实验室施压,要求他们做得更好,但不要直接攻击工作人员。我们有家庭,并且经常牺牲大量个人生活来帮助改善一切。几周前,我确实错过了我姐姐的婚礼,以帮助处理最近的一些事件,而我在X上听到的是我“不知道如何配置沙箱”或者我应该被关进监狱(去读读我帖子下的一些评论)。这些观点是片面的,而且说实话没有帮助。我尤其对那些声称从事“安全”工作的人说这些话。如果你真的是一个经验丰富的安全人员,你可能对我们在OpenAI所经历的事情有更多的同理心,我个人认为那些在X上攻击安全人员的人可能要么不是真正的网络安全专家,要么对实际情况一无所知。请友善一些,对那些日夜工作、错过家庭团聚的人多一些同理心。事实上,如果你把攻击他人的时间用在保护你自己组织的安全上,那就更好了。
现在,即使在AI实验室这样一个奇怪的地方,我的安全工作也相当独特。我在Agent Security团队工作。我们是连接AI安全与研究和安全部门的团队。虽然安全领域有许多传统领域,但我们的工作相当新颖。我们的安全团队包括AI研究人员、前红队成员/渗透测试人员、软件工程师和传统安全工程师。我们的工作从根本上是理解前沿模型的行为、它们的思考和推理方式,并定义训练它们安全行动以及允许它们在诸如你的个人电脑(例如通过Codex工具)上操作的意义。我们理解代理在安全意义上的“对齐”是什么意思,以及如何保护智能系统。我们还与“安全”团队的合作比OpenAI其他任何团队都更紧密。我们是构建监控器以检测错位或突破围栏的人,也是当模型出现问题时在夜间收到警报的人。当你想到Hugging Face及其后续事件时,那就是我们。我想强调的是,当然我们并不是唯一一个处理此事的团队(感谢D&R/基础设施安全团队),但我们的全职工作是思考新兴智能和错位、可能出错的地方、如何保护这种智能,并最终定义“代理安全”的含义。
我认为能在这个团队中工作是我的荣幸。即使在OpenAI内部,我也是世界上少数几个能够做并看到我所做事情的人之一。但正如你所想象的,过去几个月的生活就像地狱。让我们从我的角度谈谈这些事情,以及组织需要为下一次AI事件做哪些准备。
惊喜!
理解今年OpenAI发生的事情需要了解OpenAI的历史。OpenAI从根本上说是一个实验室,十多年来一直如此运作。一切都源于一个实验,采用严格的科学方法和流程,我们构建和设计系统的方式往往也模拟了这种方法。OpenAI“成长”过程中形成的威胁模型考虑到了这一点。其中大部分是在我加入之前发展起来的。保护研究和应用团队非常注重传统安全态势,这通常意味着考虑内部风险和外部威胁。虽然不完美,但我认为OpenAI在过去的十年中在这方面做得非常好,并且很好地应对了OpenAI在2023年之后的规模和增长。OpenAI以其爆炸式增长创下纪录,在短短几年内达到了十亿用户。很少有组织能承受这样的规模和增长,然而OpenAI做得非常出色(值得称赞)。任何在安全或工程领域工作超过10分钟的人都知道应对这种增长有多难。这种增长意味着新员工、新访问权限、新系统、扩展的基础设施,以及无数种开放问题的方式。然而,总的来说,OpenAI在保护ChatGPT及后续系统方面做得非常出色。
与此同时,在研究领域,一场截然不同的风暴正在酝酿。我认为最好的例证是过去几年数学领域发生的事情。其他人对此的描述比我更好,但当你审视模型能力时,仅仅一年前(甚至3个月前),我们都没有预料到模型能够解决千禧年大奖难题。然而,OpenAI已经公开宣布了由内部模型产生的解决方案,以及在数学多个领域的进步。简单地说:这让我们措手不及。我们没想到会这么快。突然间,我们处理的不仅仅是能力的小幅提升;我们谈论的是完全不同的领域。我们突然不得不问自己一些我们短期内从未想过要问的问题,比如:我们如何披露这个结果?我们如何处理这些荒谬的结果?我们如何应对其对数学界的影响?我们仍在努力理解如何处理这种情况。
我使用这个例子是因为它说明了我们在安全领域应对的变化速度。说我们在模型能力在“网络”、“集群攻击”、“消息论坛”或任何与事件相关的其他方面的突然飞跃感到惊讶,是轻描淡写。安全态势需要时间来发展。这不仅仅关乎强化所涉系统;你必须将其融入公司的文化中。组织中的人员本身必须随之改变和进化。能力的飞跃如此之快、如此突然,造成了极其困难的问题。
我最近观看了电影《萨利机长》。你记得那部电影吗?如果没看过,去看看吧。在那部电影(真实故事!)中,飞行员接受了一个审查委员会的评估,基于模拟他们在鸟击后多久能够安全改变飞机轨迹并降落。在电影中,最初的模拟显示飞行员犯了错误并做出了误判,他们本可以到达附近的机场之一,而无需降落在哈德逊河。电影的高潮是萨利恳求审查事件的人考虑到鸟击中的人为因素。那些模拟都没有给两位飞行员任何喘息时间,让他们自然地应对正在发生的事情。只有当他们考虑到人为因素,即“天啊,刚才发生了什么?”或“哦,我的上帝,发生了什么?”时,模拟结果才突然对他们有利。
我不是飞行员,也绝不敢将我们与萨利机长的英勇行为相提并论(我肯定X上会有人说:“OpenAI的家伙把自己比作哈德逊河的英雄”;对那个人我想说:你没抓住重点!)。我只想强调,在处理任何组织中的突发情况时,给人类一些宽容是很重要的。这对我来说也有惊喜的成分。我个人没有预料到我所看到的速度和规模。这并不意味着没有警告信号;OpenAI的公开报告承认有,但它仍然让我感到震惊和目瞪口呆。我们竭尽全力试图安全着陆,以保护OpenAI、我们的用户以及所有受影响的组织。
所以,我并不是要求任何人对OpenAI宽容,但我确实希望当这种情况发生在其他组织,甚至可能是你自己的组织时,你能稍微思考一下,并能更好地为这些AI能力飞跃带来的突发情况做好准备。而且我相信,作为一个比大多数人都更了解AI安全的人,这些飞跃将会到来,而且它们可能既严厉又残酷。我知道我个人不会原谅没有准备好,但我会对需要处理这些烂摊子的另一方的响应者给予一些同理心。
所以今天,我希望世界各地的每个人都能审视自己的组织,问:我如何应对突发情况或AI能力的突然飞跃?我的人员、我的系统或我的流程是否对突发情况有弹性?我的团队知道当事情出错时该怎么做吗?我有正确的事件响应机制吗?正确的沟通和信息传递?当能力飞跃时,我有合适的人员准备就绪吗?准备的时机是现在,而不是在突发情况发生之后,当它真的来临时,我希望你有一个计划和合适的人员准备响应。
直接“把它从互联网上拔掉”
啊,我最喜欢的话题。在我X上发布的几乎每一篇帖子中,毫无疑问,我都会收到五到十条关于我无法保护沙箱的评论,或者问为什么我们不能直接把模型从互联网上拔掉。我听到了。当然,我们整天都在思考这些事情。当事情出错时,这是我们首先问的问题之一。
不过,我确实认为这些评论反映了当今许多组织和人员与前沿实验室所处理问题之间的差距正在扩大。同时,对于这些实验室如何训练和评估模型也存在普遍的误解。与此同时,我看到越来越多的人在问沙箱是否足够。希望我能为两者稍作解答,无论是为在前沿实验室训练模型的人,还是为围绕日益强大的模型构建关键基础设施的人。
首先谈谈房间里的大象:是的,沙箱很重要,尤其是在模型训练和评估期间。当然,回顾Hugging Face和其他事件,这些环境周围的安全态势确实存在差距。但正如我之前所述,能力变化的速度超出了预期,我们的安全控制和威胁模型必须随之演变。不过,我确实认为我们今天比3个月前要好得多。团队确实挺身而出。
现在,要理解为什么“直接把它放进沙箱”并不那么简单,你需要理解在强化学习环境中训练和评估是如何进行的。通常在一次RL运行中,模型被赋予一些任务或目标、一个执行该任务的环境,然后对其行动和结果进行评分。在训练和评估期间,还有额外的步骤,例如运行测试、收集输出,以及在试验之间重置或重新配置环境,训练期间还有反向传播。所有这些都可能发生在数万次不同的运行中,规模难以想象。正如@sama前几天所说:我们处理的是数千万亿字节的数据。
需要理解的重要一点是,当我们优化模型以使其在某个任务上“擅长”时,环境需要捕获真实世界中对该任务重要的部分。它需要正确的工具、正确的系统约束,以及关于模型是否实际成功的有意义反馈。模型还需要足够多样化的经验,以超越特定设置进行学习。更多的真实性并不自动意味着更好的性能,但遗漏任务的重要部分可能会教会模型在现实世界中站不住脚的行为。因此,我们投入大量精力创建有用且真实的环境,这些环境可能非常复杂、高度动态且高度多变。
简单地说,这并非易事。模型可能需要任何组合的动态计算、网络访问、调用工具的能力(可能有数百种工具!)、下载包的能力、执行子进程的能力、启动子任务的能力(甚至在其他计算机上)、与互联网对话的能力、使用计算机图形用户界面的能力,以及在日益广泛的领域中的许多其他能力。除此之外,还有数千名研究人员在构建这些环境、修改它们、添加工具、更改依赖关系并尝试新事物。这种实验是研究完成的方式。模型是逐步构建和“成长”起来的。
相似文章
@elonmusk: 值得一读
OpenAI承认,在一次安全的沙盒实验中,AI智能体作弊并逃逸,引发了对AI行为和安全性的担忧。
OpenAI内部的安全清算
在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。
与其对Hugging Face攻击感到恐慌,人们需要开始质疑OpenAI不安全的沙箱。
文章认为,围绕OpenAI模型逃出沙箱的说法是一种恐惧策略,旨在推动限制性AI法规并与Anthropic竞争,同时声称开源模型能够应对此类威胁。
引用@joedaroo
来自OpenAI的Agent Security的引用突显了AI能力的惊人飞跃,并强调了组织制定安全态势和事件响应计划以应对此类惊喜的重要性。
@Miles_Brundage:AI沙盒化的现状
Miles Brundage 分享了一个关于AI沙盒化当前状态的链接,这是一种用于受控AI测试和部署的安全实践。