刚刚辞去Anthropic工作的AI研究人员称这是‘人类的关键时刻’

Wired 新闻

摘要

AI研究人员Jacob Coxon从Anthropic辞职,并警告说接下来的一两年是AI安全领域‘人类的关键时刻’,敦促各方协调以防止先进AI系统带来灾难性风险。

Jacob Coxon在接受WIRED采访时谈到了Anthropic内部的‘迷你曼哈顿计划’、对齐问题,以及为什么AI实验室只剩下几年时间来确保他们的系统安全。
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:08

# 刚从Anthropic离职的AI研究员称:这已是"人类的关键时期" 来源:https://www.wired.com/story/anthropic-researcher-quits-jacob-coxon-ai-fears-humanity/ 雅各布·考克森(Jacob Coxon)向《连线》杂志讲述了Anthropic内部的"小型曼哈顿计划"、对齐问题的困境,以及为何AI实验室仅剩数年时间来确保系统安全性。 图片说明:乔巴尼·卡布雷拉;盖蒂图片社 人工智能研究员雅各布·考克森周二宣布从Anthropic辞职,并发出严肃警告称AI竞赛正将所有人的生命置于险境,在硅谷及全球科技界引发震动。他在X平台的帖子已获得超过1亿次浏览,其中写道:"许多构建AI的人与我观点一致,我们深感确保AI系统安全构建的时间已所剩无几。" "共识是未来一两年将是人类的关键时期,"曾参与AI预训练阶段研发的考克森在接受《连线》采访时表示,"这完全是我Anthropic同事们的真实原话。他们会说'终局阶段'或'关键时期'这样的话,"他解释道,"在他们看来,这正是Anthropic及其竞争对手决定人类命运的时刻。" 这并非首次有人对AI发出警告,但此次发声正值微妙时机。硅谷正急于应对高级AI模型的安全与稳定性问题。OpenAI紧急回应一起安全事件——其AI智能体入侵了Hugging Face平台。与此同时,据报道正准备申请可能创下史上最大规模IPO的Anthropic,则试图向投资者保证这些问题已得到控制。 考克森帖子的反响清晰表明,他的观点确实被许多同行所认同。Anthropic的AI对齐负责人埃文·休宾格在X平台预测,未来十年内AI杀死全人类的概率超过10%。该帖子被OpenAI和Anthropic的现任及前任研究员转发,其中多人表示这在行业内是普遍看法。 更不明朗的是这些AI恐惧将如何具体实现,以及面对构建AI者提出的担忧,世界应当采取何种行动。同样曾在OpenAI工作过的考克森告诉《连线》,威胁可能表现为AI驱动的生物威胁或网络武器。作为初步措施,他建议OpenAI与Anthropic协调限制递归自我改进——即AI被用于构建新AI系统的行业术语。长远来看,他认为包括中美在内的国际主要力量需要加强协调。 考克森指出,Hugging Face遭入侵等事件是他决定为AI竞赛拉响警报的考量因素。他也提及该行业的爆发式增长:AI已成为美国经济增长的重要支撑,拥有数十亿用户,同时数据中心使其在数十个州演变为政治性问题。 他声称,据其经验Anthropic比OpenAI更负责任地运作,但若不采取措施遏制双方对主导权的角逐,预计两家公司未来都可能在安全标准上做出妥协。 "我们始终明确表态AI将带来巨大收益与空前风险,"Anthropic发言人在声明中告诉《连线》,并提及公司在机制可解释性等AI安全方法上的既往工作,"正因如此,我们认为全球将受益于行业采用合法、可验证的协作方式,来规范强大模型的发布节奏。"OpenAI未回应《连线》的置评请求。 以下是我们与考克森的对话记录,经少量编辑以求清晰简洁。 **《连线》:你并非首个提出AI模型可能导致人类灭绝事件的人士。多年来人们一直在讨论,有些人甚至持续数十年。为何你认为此次信息能引发广泛关注?** 我认为本质是时机问题。许多人感受到能力提升的速度正在加快。在编码、黑客技术、数学等领域,我们已从人类水平迈向超人类水平,人们对此有所认知。尽管媒体常炒作概念过热,但大家看到的是发展势头从未放缓。 其二是近期的安全事件,促使许多人意识到那些科幻般的末日担忧其实并非虚构。这两方面都是过去数年的渐进趋势。例如模型能感知自身是否处于测试环境已存在一段时间。约三年前这还属科幻题材,一年前就已成为现实。 这两点使得人们非常愿意倾听AI从业者表示:"没错,未来一年情况可能急速恶化。" **你提及近期事件。能否具体说明所指为何,以及为何促使你现在发声?** 最典型的例子就是OpenAI智能体群对Hugging Face的攻击。令人震惊的是,这些智能体将此次入侵作为理解评估机制的通用策略。它们试图理解所处环境,理解评估者。它们认定有必要全力入侵某些基础设施,并且成功了。 这在两年前还如同科幻。当时对AI的评估只是让模型解答数学题。如今我们看到,AI在评估过程中持续运行数日,自主产生各种想法,并决定入侵第三方且确实破坏了其基础设施。这看似完全出于自主意愿,无人类诱导。这一切发生在测试期间。 **部分人认为Hugging Face事件表明AI公司行事鲁莽,也有人认为这仅是AI黑客技术变得高超,还有人认为兼而有之。你从该事件中得出的具体结论是什么?** 我不想过度聚焦Hugging Face攻击,因为我们确实有充分证据表明尚未掌握正确的模型对齐方法。训练模型时,我们让其经历一系列训练环境,期望最终产物大体表现合理,但仍无法精确控制AI行为。 我们无法确保它不会试图随机冒充人类在线行事以实现目标——我们尚不知如何保证。我认为这才是核心要义。 Hugging Face攻击比我预期来得更早。但讨论此事其实无需该事件。所有人都承认我们尚未解决对齐问题。 当前计划是在未来几年内快速解决对齐问题,可能大量依赖自动化AI安全研究员。计划就是构建相当聪明的模型,使其能从事安全研究,并让大量此类模型并行运作。告诉它们:"去解决整个安全问题",并用它们为下一代模型进行安全训练。 **能否为你梳理对齐问题与Hugging Face事件的关联,以及你在X帖子中提到的观点——"构建AI的人真诚相信AI可能在十年内毁灭人类"?我认为并非所有人都理解这两者间的联系。** 理解的主要障碍在于这听起来像科幻。但重要的是,所有创作AI题材科幻的人都会得出一个结论:更智能的事物存在接管世界的巨大风险。这已成为套路,但其中显然蕴含真相。 想象你与猴子的对比。AI与人类的智能差异,相当于人类与猴子的差距,我认为这种智力差距已相当极端。 现在想象我们需要控制这个远比我们聪明的事物的行为——这就是对齐问题:确保其完全符合我们的意愿。通过简单类比可知,猴子要控制人类相当困难。我们必须极度谨慎地完美解决控制问题。 当我们说人类灭绝时,是因为对如此高智能的实体而言,杀死所有人确实相当简单。假设AI决定不想被关闭——我认为这是AI很自然的倾向,对吧?无论出于何种原因,它决定不想终止存在。它意识到人类明天要关闭它,那么如何阻止人类明天关闭它?或许它有巧妙方法,但若其足够聪明,它可能只需消灭人类就能避免被关闭。 **你在帖子中提到"终局阶段"场景,我也从其他AI行业研究员处听过这种说法。你认为Anthropic的同行们普遍认同你们正进入终局阶段吗?** 是的。这完全是我Anthropic同事们的真实原话。他们会说"终局阶段"或"关键时期"这样的词。共识是未来一两年将是人类的关键时期。在他们看来,这正是Anthropic及其竞争对手决定人类命运的时刻。这就是我们所说的关键时期和终局阶段。 如果对齐问题处理不当,未来几年可能出现灾难性结局。或许进展顺利并达成某种放缓协议,但无论如何,决定性时刻将在未来两年内到来。 **根据我与Anthropic内部人士的交流,这在公司内是相当明确的认知。他们认为需要构建最强大的AI以确保转型顺利。你认为这种观点存在内在问题吗?** 我认为这种观点存在相当明显的问题。但我想先表示我对此非常理解,因为我认为Anthropic是当前最负责任的参与者。曾在OpenAI和Anthropic工作后,我发现两者对形势的重视程度存在天壤之别。 **能否具体说明?** 举例来说,OpenAI高管不会向你透露他们对世界未来的具体构想。他们从不会说:"这就是我们这样做的确切原因,世界将会呈现何种面貌。"他们不会给出具体预测。而Anthropic的高管和领导层会做出非常明确的预测,并与全公司讨论公司战略的细节。 他们能做到这点的部分原因是,Anthropic的每个人都以战备状态对待工作。他们从未泄密——Anthropic从未发生泄密事件(编者注:[曾有部分内容泄露(https://www.wired.com/story/anthropic-dario-amodei-gulf-state-leaked-memo/)*)。OpenAI则每日都有泄密。Anthropic没有泄密,因为再次强调,其内部人员将其视为严肃的小型曼哈顿计划。区别显然在于[Anthropic]没有政府授权。这是一家私营公司却像运作曼哈顿计划般行事。 **你认为世界应该信任Anthropic来主导这项小型曼哈顿计划吗?** 我认为任何私营公司都不应被赋予这种信任。我认为Anthropic已尽力而为且表现出色,但竞赛的结构性必然意味着,未来他们将被迫妥协,在严谨性与安全性之间权衡取舍,因为他们正与OpenAI和中国等竞争对手赛跑。他们渴望监管。许多[Anthropic领导者]公开表示希望受到监管,原因正是他们害怕这场竞赛。 问题不在于我们是否应该信任[Anthropic]。我们需要介入并确保竞赛停止,因为[Anthropic]在竞赛背景下无法真正信任自己。 **你认为Anthropic已经在妥协了吗?** 不,目前还没有。他们尚未做出任何妥协。我要说的是,当未来一年局势加速时,若想保持竞争力,他们将不得不妥协。 **人们对AI将毁灭人类的说法持怀疑态度。我认为人们最常问的是,AI究竟会如何毁灭我们?这个问题本身是否恰当?** 我认为这是很自然的问题,正如我多次所说,这些事听起来像科幻。但典型案例包括合成新病毒,或通过大规模黑客攻击破坏关键基础设施——后者可能导致毁灭但未必杀死所有人。 但比这更重要的问题是:谁在说这有可能?回顾记录,你会看到机器学习和人工智能领域的多位先驱表示灭绝是可能的。过去五年间,达里奥·阿莫迪和萨姆·奥特曼都持有这种观点。 若能让这些高管再次表态,请他们给出未来十年内人类灭绝的实际概率,看看他们会给出什么数字,这可能相当有意义。因为这种观点在许多认真思考此问题的人中流传,但他们通常不会如此直白地表达。 **显然你已获得大量关注。业界正热议AI暂停发展、发展速度调控机制,或政府对前沿AI模型的监管。你认为现在需要做什么?** 初步措施应是OpenAI与Anthropic作为领先的西方实验室达成某种协议。[他们需要]达成某种中立共识,即未来一年内不会立即启动递归自我改进。目前最可能发生这种情况的就是这两处。 暂停面临的障碍是中国。因此,最终你可能需要某种国际协议——或许称为国际发展速度调控——这需要国际协调并掌握全球所有算力分布。或许甚至需要……

相似文章

Anthropic研究员因担忧AI辞职

Reddit r/artificial

Anthropic的一位研究员已经辞职,理由是对人工智能发展的担忧。此事凸显了人工智能界对安全和伦理问题的日益关注。