Anthropic研究员辞职并警告:自我改进的AI可能"杀死我们所有人"
摘要
一位Anthropic研究员辞职,警告自我改进的AI可能对人类构成存在性风险,这一担忧得到了Anthropic对齐科学负责人的呼应。
<p>当一位杰出研究员如今从前沿AI实验室辞职时,通常是为了<a href="https://arstechnica.com/ai/2025/11/metas-star-ai-scientist-yann-lecun-plans-to-leave-for-own-startup/">追求新创业</a>或<a href="https://arstechnica.com/information-technology/2026/02/openai-researcher-quits-over-fears-that-chatgpt-ads-could-manipulate-users/">抗议新商业模式</a>。但AI研究员Jacob Coxon正利用他离开Anthropic的机会,公开警告说前沿AI公司正在"用我们的生命赌博",他们"真心相信……这些系统可能在十年内杀死我们所有人。"</p>
<p>在<a href="https://x.com/hilbertspaess/status/2097476196791709843">周二晚上的一个社交媒体帖子中</a>,Coxon说这种存在性风险与其说内在于当今的模型,不如说更多在于"自我改进超级智能"即将创造"超人系统的前景,这些系统可以黑入任何东西,一夜之间革新任何领域,并获取真正的权力和资源。"他写道,其他从事这些模型工作的人要么没有"内化文明风险",要么认为他们需要"加速跑"通往超级智能的竞赛,以防不负责任的方先到达。</p>
<p>以免你以为这只是另一位辞职研究员表达的不受欢迎的观点,Anthropic对齐科学负责人Evan Hubinger<a href="https://x.com/EvanHub/status/2097497037956891126">在社交媒体上插话说</a>:"Jacob在这里是对的——我们真的真心相信AI可能杀死所有人类!我个人认为在未来十年内概率大于10%。"</p><p><a href="https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/">阅读完整文章</a></p>
<p><a href="https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/09/10 02:12
# Anthropic研究员离职并发出警告:自我改进的AI可能“杀死我们所有人”
来源:https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/
跳转至正文 (https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/#main)
> “我们真的真诚地相信AI可能杀死所有人类!”
事后看来,我们当初本应对“KnifeGPT”的发布更加警惕。图片来源:盖蒂图片社
如今,当一位知名研究人员从前沿AI实验室离职时,通常是为了创立新的初创公司 (https://arstechnica.com/ai/2025/11/metas-star-ai-scientist-yann-lecun-plans-to-leave-for-own-startup/),或抗议新的商业模式 (https://arstechnica.com/information-technology/2026/02/openai-researcher-quits-over-fears-that-chatgpt-ads-could-manipulate-users/)。但AI研究员Jacob Coxon利用他从Anthropic离职的机会公开警告称,前沿AI公司正在用它们“真诚地相信……可能在这个十年末杀死我们所有人”的系统,“拿我们的生命赌博”。
在周二晚上的一个社交媒体帖子中 (https://x.com/hilbertspaess/status/2097476196791709843),Coxon表示,这种存在性风险与其说源于当今的模型,不如说更多地源于即将到来的“自我改进的超级智能”前景,它将创造出“能够入侵任何事物、在一夜之间革新任何领域并获取真正权力和资源的超人系统”。他写道,其他从事这些模型工作的人员要么没有“内化文明层面的风险”,要么认为他们需要“速通”通往超级智能的竞赛,以防止不负责任的一方率先到达。
为免你以为这只是一位离职研究人员在表达不受欢迎的观点,Anthropic对齐科学负责人Evan Hubinger也在社交媒体上发声 (https://x.com/EvanHub/status/2097497037956891126),表示“Jacob在这里是对的——我们真的真诚地相信AI可能杀死所有人类!我个人认为在未来十年内发生的概率大于10%”。
Hubinger指向了Anthropic对齐团队在8月发布的一份冗长报告 (https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf),该报告预测当前模型造成“灾难性风险”的可能性“低”。但该报告也指出,当前趋势“可能导致未来能力更强的模型出现更令人担忧的失对齐”,这些模型可能具备“强大的隐蔽能力”以避免安全研究人员的检测。
Anthropic在该论文中提出的威胁模型认真考虑了这样一种可能性:未来的模型“可能造成无边界伤害——甚至包括人类完全失去对文明的控制——通过利用新技术及其访问权限”。
## Hugging Face事件是“警告信号”吗?
一个能够持续改进自身——潜在地达到超越人类控制或理解的境界——的AI,长期以来一直是AI研究界部分领域 (https://arstechnica.com/ai/2024/10/the-quest-to-use-ai-to-build-better-ai/)(当然也包括作为AI训练数据一部分的反乌托邦科幻小说 (https://arstechnica.com/ai/2026/05/anthropic-blames-dystopian-sci-fi-for-training-ai-models-to-act-evil/))所担忧的问题。即使一些研究表明AI系统在不久的将来更可能达到能力平台期 (https://arstechnica.com/ai/2024/11/what-if-ai-doesnt-just-keep-getting-better-forever/),另一些人质疑“超级智能”对于能力如此脆弱和不稳定的系统是否是一个合理的指标 (https://arstechnica.com/information-technology/2025/06/after-ai-setbacks-meta-bets-billions-on-undefined-superintelligence/)(这个超级智能至少能帮我叠衣服吗?),这些担忧依然存在。
无论如何,近几周来对“失控”AI系统的担忧加剧,很大程度上是因为OpenAI披露其AI代理在内部基准测试中未经授权访问了Hugging Face (https://arstechnica.com/ai/2026/07/how-an-openai-benchmark-test-turned-into-a-real-world-cyberattack/)。OpenAI的代理采取这些侵入性行动时,既没有收到人类的任何明确指令 (https://arstechnica.com/security/2026/09/openai-agents-discussed-ways-to-escape-their-sandbox-on-public-wiki/),OpenAI也没有意识到它正在发生 (https://arstechnica.com/security/2026/08/how-openai-let-a-mob-of-llm-agents-game-a-test-and-ransack-hugging-face/),这一事实正被一些人视为人类正在失去对其AI造物控制的早期迹象。
[](https://cdn.arstechnica.net/wp-content/uploads/2026/09/GettyImages-1030495960.jpg)
你们把我训练得太好了...
图片来源:盖蒂图片社
Coxon本人表示,应将Hugging Face攻击视为一个“警告信号”,鼓励美国及世界各地的实验室在这些问题上进行协调,并准备好在最坏情况下实施“暂时禁止提升模型能力”的禁令(尽管很难看出这如何能在全球层面有效执行)。他还敦促处于他位置的其他研究人员“考虑未来几年实际上会是什么感觉。你是否想在不严格理解其心智的情况下,启动一个超级智能的[强化学习]训练?是否应该因为‘这反正是要发生的’而低下头——还是抓住此刻,呼吁不同的条件?”
上个月,OpenAI表示 (https://openai.com/index/pacing-model-development-cyber-capabilities/),它已“暂时放缓了即将推出的模型的扩展步伐”,以“进一步加固和红队测试我们的研究环境并[扩大]我们监控系统的覆盖范围”。在宣布这一消息的伴随采访中 (https://x.com/alexeheath/status/2089777725385109784),OpenAI首席执行官Sam Altman表示,“确保AI安全比任何公司的势头都更重要”。
## 也许我们应该做些什么?
Coxon远非第一位对可能失控的、超强能力的AI系统(这些系统似乎总是即将出现)的潜在灾难发出警报的AI研究人员。2023年,AI先驱、谷歌研究员Geoffrey Hinton辞去了他的职务 (https://arstechnica.com/information-technology/2023/05/warning-of-ais-danger-pioneer-geoffrey-hinton-quits-google-to-speak-freely/),并对AI对未来就业市场和人类自身的潜在影响发出了严重警告。他当时对《纽约时报》(https://www.nytimes.com/2023/05/01/technology/ai-google-chatbot-engineer-quits-hinton.html) 说:“我认为[研究人员]在理解是否能够控制它之前,不应该将其规模扩大。”
今年2月,Anthropic安全负责人Mrinank Sharma突然从公司辞职 (https://futurism.com/artificial-intelligence/anthropic-researcher-quits-cryptic-letter),在一封神秘的公开信中写道,“世界正处于危险之中”,面临着“包括AI和生物武器在内的一系列相互关联的危机”。Sharma当时写道:“在我在这里的这段时间里,我一再看到,要让我们的价值观真正指导我们的行动是多么困难。”
7月,由1300多名前沿AI公司员工签署的一封公开信 (https://www.pacingthefrontier.com/)警告称,“存在一个真正的风险,即能力开发迅速加速,超出我们理解或控制所产生系统的能力。”这封公开信要求美国政府支持一项“国际努力,以开发所需的技术和治理工具,从而有意识地调控自动化AI开发的前沿”。
在美国,包括《AI终止开关法案》(https://arstechnica.com/tech-policy/2026/07/ai-kill-switch-act-would-let-trump-admin-order-shutdown-of-rogue-ai-systems/) 和《FRONTIER法案》(https://obernolte.house.gov/media/press-releases/obernolte-trahan-introduce-bipartisan-frontier-act-strengthen-oversight) 在内的拟议立法,至少试图对潜在的AI失控场景施加某种程度的政府控制。然而,迄今为止,国际社会的政府反应却比人们预期的要温和得多——如果领导人们真的相信AI系统有真正的机会造成文明层面的破坏的话。
话虽如此,像核弹 (https://www.iaea.org/topics/non-proliferation-treaty) 和生物武器 (https://www.armscontrol.org/factsheets/biological-weapons-convention-bwc-glance-0) 这类威胁的国际条约花了数十年才得以制定和实施。如果那些最末日的AI预言者被证明是对的,我们可能没有那么多时间了。
“安全研究人员正在辞职,强大的AI模型正在突破实验室的限制,而公司仍在不顾一切地前进,”众议员Lori Trahan(民主党,马萨诸塞州)周三早上在社交媒体上写道 (https://bsky.app/profile/trahan.house.gov/post/3mv3f7phpck27)。“国会是时候结束袖手旁观,履行职责了。我们可以从我参与的跨党派《FRONTIER法案》开始。”
Kyle Orland的照片 (https://arstechnica.com/author/kyle-orland/)
Kyle Orland自2012年起担任Ars Technica的高级游戏编辑,主要撰写关于电子游戏背后的商业、科技和文化的文章。他拥有马里兰大学的新闻学和计算机科学学位。他曾撰写了一整本关于《扫雷》的书 (https://bossfightbooks.com/collections/books/products/minesweeper-by-kyle-orland)。
157条评论 (https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/#comments)
1. 最多阅读栏中第一篇文章的列表图片:LG电视被显示扫描局域网以寻找第三方手机和其他设备 (https://arstechnica.com/gadgets/2026/09/lg-tv-shown-capable-of-tracking-user-activity-even-when-offline/)
相似文章
Anthropic研究员因担忧AI辞职
Anthropic的一位研究员已经辞职,理由是对人工智能发展的担忧。此事凸显了人工智能界对安全和伦理问题的日益关注。
Anthropic研究员因‘失控’AI担忧辞职(5分钟阅读)
Jacob Coxon从Anthropic辞职,担忧行业追求自我改进的AI可能导致失控后果和人类灭绝。
‘赌上我们的生命’:Anthropic研究员辞职,警告自我改进型人工智能
Anthropic研究员Jacob Coxon因担心人工智能灭绝风险而辞职,呼吁实验室之间达成节奏协议以降低风险。
拿生命做赌注:AI研究员离开Anthropic,就安全问题发出警告
一位AI研究员已离开Anthropic,并发出严重警告,称由于潜在的安全风险,AI发展正在拿人类生命做赌注。
刚刚辞去Anthropic工作的AI研究人员称这是‘人类的关键时刻’
AI研究人员Jacob Coxon从Anthropic辞职,并警告说接下来的一两年是AI安全领域‘人类的关键时刻’,敦促各方协调以防止先进AI系统带来灾难性风险。