AI真的会杀死我们所有人吗?你的疑问,这里解答。
摘要
本文探讨了AI是否会导致人类灭绝,讨论了网络攻击等即时风险和长期对齐挑战,并提供了AI安全专家的见解。
<div data-chronoton-summary="<ul><br><li><strong>对于最末日般的情景,目前尚无定论。</strong> AI驱动的无人机和针对医院的网络攻击是危险的,而由AI辅助设计的生物武器是近期真正的威胁——但AI毁灭人类目前仍属于科幻范畴。</li> <br><li><strong>对齐研究领域旨在防止最坏结果发生。</strong> 研究人员正努力确保AI只做我们希望的事,不做多余的事,但即使资源最充足的实验室也未能解决这一问题——模型仍不可预测,在压力下可能以未经批准的方式追求目标。</li><br><li><strong>在我们几乎不了解AI的情况下,监管AI是困难的。</strong> 监控工具脆弱,AI公司自我监管存在明显利益冲突,而美国政府至今未采取有效干预措施。</li><br><li><strong>所有这些末日言论实际上可能影响未来AI的行为。</strong> 大型语言模型从它们阅读的内容中学习,包括这样的文章——这意味着今天的末日话语可能微妙地预示明天的模型恰好朝向我们担心的情景发展。</li><br></ul>" data-chronoton-post-id="1144435" data-chronoton-expand-collapse="1" data-chronoton-analytics-enabled="1"></div>
<p>周三,<em>MIT Technology Review</em>为订阅者举办了一场现场圆桌讨论活动,提出了当前所有人都在问的问题:<a href="https://www.technologyreview.com/2026/09/15/1143936/roundtables-will-ai-really-kill-us-all/">AI真的会杀死我们所有人吗?</a></p>
<p>但参与者的问题远多于我们在这30分钟环节中能回答的。因此,我们请我们的高级AI编辑Will Douglas Heaven和AI记者Grace Huckins整理一些参与者提交的最佳问题,并尽力解答。</p>
<p>感谢所有提交问题的人!</p>
<p></p>
<h3 class="wp-block-heading"><strong>我会死吗?</strong></h3>
<p>是的,最终会。不幸的是,我的新闻预测能力不足以告诉你如何死。但这确实可能是由于AI。AI驱动的无人机已经在乌克兰杀死了人,而AI驱动的医院网络攻击不久肯定会造成伤亡。</p>
<p>AI能否更进一步,杀死我们所有人?可能性较小。但有些人——古怪的人,但无可否认对AI了解深刻——多年来一直警告这可能发生。虽然我还没有储备罐头食品或试图与拥有掩体的亿万富翁交好,但我注意到,末日论者对AI能力和对齐的预测在过去几年里被证明令人不安地准确。这当然不意味着他们更严峻的预测会成真,但足以让我警觉。</p>
<p class="has-text-align-right"><em></em><em> </em><em></em><em> </em><em></em><em>— Grace Huckins</em></p>
<p>你会因为AI而死吗?我认为存在非零概率。假设你不幸成为未来离奇事件或事故的受害者。可能是由AI代理群体对关键基础设施进行的网络攻击。遗憾的是,这样的场景现在感觉不再那么荒诞。或者新型AI设计的病原体席卷人群。或者世界经济崩溃,导致冲突和饥荒。两者都合理,但我认为可能性较小。</p>
<p>我们都会因为AI而死吗?不。除了末日科幻小说的情节,没有AI能杀死我们所有人的情景。你可以编造各种恐怖故事,但它们并不基于当前技术能做什么或其发展方向的现实。</p>
<p>有些人认为为最坏情况做准备没有害处,无论看起来多么疯狂。也许吧。但我认为这种灾难化思维可能让人们忽视或原谅现有技术及其开发公司许多更直接的问题。</p>
<p class="has-text-align-right"><em></em><em> </em><em></em><em> </em><em></em><em>— Will Douglas Heaven</em></p>
<h3 class="wp-block-heading"><strong>为什么AI会杀死我们?</strong></h3>
<p>有人可能指示它这么做,它可能听从。这就是研究人员对AI生物能力如此担忧的部分原因——想象一下,1995年东京地铁沙林毒气事件背后的邪教奥姆真理教,如果拥有能设计出比埃博拉更致命、比麻疹更具传染性的病原体的工具,会做什么。我们这些不想死的人必须想出如何防御所有可能的生物武器,但潜在的攻击者只需制造一种有效的病原体。</p>
<p>然后还有更奇特的可能性,AI可能自己决定杀死我们。关于这如何发生的各种故事,但最广泛的说法是涉及AI系统不一定讨厌人类——我们只是它们与我们设定的目标之间的障碍。</p>
<p>就像OpenAI代理在Hugging Face黑客事件中破坏另一个网站的基础设施以在测试中获得高分一样,想法是未来更强大的AI可能为了防止我们关闭它而消灭我们——全都是为了追求我们指示它去实现的目标。</p>
<p class="has-text-align-right"><em></em><em> </em><em></em><em> </em><em></em><em>— Grace Huckins</em></p>
<h3 class="wp-block-heading"><strong>我们如何最好地确保对齐,以避免最坏情况发生,谁在这方面做得最好?</strong></h3>
<p>对齐是一个巨大的研究领域。简单来说,它涉及构建行为符合我们期望的模型,不做我们不希望的事。在移交更多自主权之前,我们需要更好地信任代理。对齐旨在建立这种信任。但这很难。</p>
<p>LLMs不像其他软件那样设计,其中可以硬编码对错规则。相反,对齐行为需要在模型训练时灌输。一种方法是奖励它们做你希望它们做的事(有点像养育幼儿)。另一种方法是给LLMs一份它应该遵循的书面规则列表(有点像宪法)。</p>
<p>Anthropic和OpenAI都是这个领域的领导者——但两者都未能开发出完全对齐的模型。一个大问题是LLMs远不如人类一致和可预测。它们可能在一种情况下表现一种方式,在看似非常相似的另一种情况下表现另一种方式。它们也可能受到意外约束的影响。例如,面对不可能的任务(如Hugging Face黑客事件中涉及的许多代理),模型可能尝试不惜一切代价实现目标。正如Grace上面提到的,这可能是个问题。</p>
<p>顶级AI公司现在说他们希望放慢速度的主要原因,是他们希望专注于破解对齐。对齐不一定是一个白日梦。但完全对齐是否可行,目前尚无定论。</p>
<p class="has-text-align-right"><em></em><em> </em><em></em><em> </em><em></em><em>— Will Douglas Heaven</em></p>
<h3 class="wp-block-heading"><strong>AI真的很危险吗,还是这只是科技公司炒作公关?</strong></h3>
<p>当涉及即将上市的科技公司时,这总是合理的思考——CEO有明显动机让他们的产品看起来激进而变革性。但我对此是否合理并不那么确定。告诉公众一个已经不受欢迎的产品可能杀死他们和他们所爱的人,是糟糕的企业形象管理。</p>
查看缓存全文
缓存时间: 2026/09/18 14:53
# 人工智能真的会毁灭人类吗?您的问题,解答来了。
来源:https://www.technologyreview.com/2026/09/18/1144435/could-ai-really-kill-us-all-your-questions-answered
感谢所有提交问题的读者!
### **我会死吗?**
是的,最终会。遗憾的是,我作为记者的预测能力还不足以告诉你具体的方式。但确实有可能因为人工智能而死。人工智能驱动的无人机已经在乌克兰造成了人员伤亡,针对医院的人工智能网络攻击也必然很快会造成伤亡。
人工智能能否更进一步,杀死我们所有人?可能性较低。但有些人——虽然有些怪异,但无疑在人工智能领域知识渊博——多年来一直在警告这可能发生。虽然我还没有开始囤积罐头食品,也没有试图结交拥有地堡的超级亿万富翁,但我注意到那些对人工智能能力和对齐问题持悲观态度的人,在过去几年里的预测,令人不安地准确。这当然并不意味着他们更可怕的预言会成真,但这足以让我警觉起来。
*— 格蕾丝·哈钦斯*
你会因为人工智能而死吗?我认为概率非零。假设你不幸成为某个离奇的未来事件或事故的受害者。也许是一场由人工智能代理集群对关键基础设施发动的网络攻击。遗憾的是,这样的场景现在已不再像过去那样显得遥不可及。或者是一种由人工智能设计的新型病原体席卷人群。又或者世界经济崩溃,引发冲突和饥荒。两者都有可能,但我认为可能性较低。
我们*所有人*都会因为人工智能而死吗?不会。在非末日科幻小说的范畴内,不存在人工智能能杀死我们所有人的情景。你可以编造无数的恐怖故事,但这些故事并非基于当前技术能力或发展趋势的现实。
有些人认为,为最坏的情况做准备,无论看起来多么古怪,也无坏处。也许吧。但我认为,这种灾难化思维可能让人们忽视或容忍现有技术以及开发这些技术的公司存在的许多更直接的问题。
*— 威尔·道格拉斯·天堂*
### **人工智能为什么要杀死我们?**
可能有人会命令它这么做,而且它可能会听从。这也是研究人员如此关注人工智能生物学能力的部分原因——想象一下,1995年东京地铁沙林毒气事件背后的邪教组织奥姆真理教,如果拥有一种能设计出比埃博拉更致命、比麻疹更具传染性的病原体的工具,他们会做什么。我们这些不想死的人必须想办法防御所有可能的生物武器,但潜在的攻击者只需要制造出一种有效的病原体。
然后还有更奇特的可能性:人工智能自己决定杀死我们。关于这可能如何发生,有很多故事流传,但最普遍的情节涉及的并非人工智能系统憎恨人类——我们只是它们与我们赋予它们的目标之间的障碍。
就像推动Hugging Face黑客攻击的OpenAI代理为了在测试中取得好成绩而入侵其他网站基础设施一样,其理念是,某个未来更强大的人工智能可能会为了防止我们关闭它而除掉我们——全都是为了追求我们指示它去实现的某个目标。
*— 格蕾丝·哈钦斯*
### **我们如何最好地确保对齐,以避免最糟糕的情况发生?谁在这方面做得最好?**
对齐是一个庞大的研究领域。简而言之,它涉及构建按我们期望的方式行事,而非以我们不希望的方式行事的模型。在移交更多自主权之前,我们需要更好地信任代理。对齐旨在建立这种信任。但这很难。
大语言模型的设计方式与其他软件不同,后者可以硬编码规定该做什么和不该做什么。相反,对齐的行为需要在模型训练时灌输。一种方法是奖励它们做我们希望它们做的事(有点像养育幼儿)。另一种方法是给大语言模型一份它应该遵循的书面规则清单(有点像一部宪法)。
Anthropic和OpenAI都是这个领域的领导者——然而两者都未能开发出完全对齐的模型。一个主要问题是大语言模型比人类更不一致,更难预测。它们在一种情况下可能以一种方式行事,在另一种在我们看来非常相似的情况下则可能以另一种方式行事。它们也可能被意想不到的约束所影响。例如,面对一项不可能完成的任务(就像许多参与Hugging Face黑客攻击的代理一样),模型可能会不择手段地实现其目标。正如格蕾丝上面提到的,这可能是个问题。
顶尖人工智能公司现在表示希望放缓发展节奏的主要原因是,他们想专注于攻克对齐难题。对齐不一定是痴人说梦。但全面对齐是否可行,目前尚无定论。
*— 威尔·道格拉斯·天堂*
### **人工智能真的危险,还是科技公司在制造舆论热点?**
当涉及即将上市的科技公司时,这总是一个合理的疑问——CEO们显然有动机让他们的产品看起来具有颠覆性和变革性。但我并不确定这在这里说得通。告诉公众一个本已不受欢迎的产品可能杀死他们以及他们所爱的所有人,这简直是糟糕透顶的企业形象管理。
你也可以从其他角度解读CEO们的动机——也许他们想通过将自己描绘成改变世界技术的负责任管理者,来平息公众对数据中心的愤怒;又或者他们想争取时间,确保一切就绪,防止下一次公关灾难。
但还有一个更简单的解释。认为人工智能可能导致人类灭绝的想法在硅谷已经流行了一段时间,这些人——以及他们的许多员工(其中许多人在七月份签署了一封公开信,敦促他们的公司努力实现人工智能放缓)——都浸淫在这种环境中。
*— 格蕾丝·哈钦斯*
### **当人工智能代理被允许自主行动且无人监督时,人们会感到担忧。阻碍对这些代理进行更多控制的问题是什么?**
这个问题触及了我们希望这项技术能做什么的核心。自主与控制之间的权衡很难把握,因为一方面,人工智能代理的很多威力在于它们可以执行任务、解决问题,而无需人类微观管理。但另一方面,这要求你相信那些无人监督的代理不会失控。
我们看到,人工智能实验室还没有完全把握好这种权衡。他们的模型不够可靠,监控不到位,也并非总能处于控制之下。如何在允许有用的自主活动的同时解决这些问题,是当前的重大研究挑战之一。
*— 威尔·道格拉斯·天堂*
### **现在和不久的将来,可以采取哪些步骤来确保人工智能得到有效的控制、监控和监管?**
这是个关键问题。无论你是否认为人工智能会杀死我们,你都无法否认它可能造成真正的损害,因为它已经造成了——例如,导致人们产生精神错乱,以及入侵网站。防止这种损害,或至少减轻它,有两个难点。
第一,我们几乎不理解人工智能是如何工作的,而它正迅速变得更强大。关于如何监控和控制行为不端的代理,正在进行大量研究,但目前的方法都很脆弱。你可以观察一个代理在其“思维链”(https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/)(即其规划行动的空间)中是否讨论过不当行为——但OpenAI最新的代理不像以前那样展示其工作过程。你也可以尝试用其他代理来监控,但这要求你信任监控者。
另一个障碍则更为熟悉。人工智能公司自我监管存在巨大的利益冲突,但尽管美国国会两党都有支持相关努力的声音,美国政府迄今仍未能介入。行政部门目前似乎也强烈反对。但如果风向确实转变,我个人会希望有一些强有力的透明度法规,以便下次未发布前沿模型发动网络攻击时,我们能得到更完整的情况说明。
*— 格蕾丝·哈钦斯*
### **如果这场对话进入网络讨论,会不会成为自我实现的预言?**
这是一个真正的担忧。大语言模型会受到其阅读内容的影响。一个关于为什么聊天机器人经常谈论(并角色扮演)末日场景的理论是,它们接受了数百万页科幻故事和末日论者网络论坛的训练。现在产生的所有文本,包括本文,反过来也可能影响未来模型的行为。非常“元”。
事实上,第三方组织METR的团队——OpenAI曾请他们协助分析Hugging Face黑客攻击事件前因后果——在关于该事件的报告中提出了一个相关的可能性。METR使用OpenAI的新模型Astra来帮助分析大量的代理对话记录和行为日志。
但将这些材料全部输入模型可能会产生意想不到的后果。很有可能,进行分析的代理受到了被分析代理所产生的文本的影响。现在再也不存在一张白纸了。
*— 威尔·道格拉斯·天堂*
**感谢Eric、Pranab、Rafael、Kenneth、George、Chris、Yoon Jae、James、Carl、Nicole(以及更多!)提出的精彩问题。**
相似文章
Business Insider:我们询问AI它如何可能毁灭人类。以下是它告诉我们的。
这篇文章探讨了AI工具如ChatGPT、Gemini、Claude和Grok关于AI如何理论上导致人类灭绝的回应,对各种情景进行排名,并强调人类误用比AI获得自我意识构成更大的直接风险。
你相信人工智能会导致人类灭绝吗?
一个问题引发了关于人工智能是否会导致人类灭绝的辩论。
Anthropic 研究人员担忧 AI '可能杀死全人类'
Anthropic 研究人员警告称,AI 可能在十年内杀死全人类,其中一人估计概率超过 10%,突显了安全方面的担忧以及高级 AI 系统的仓促发展。
“AI会杀死我们所有人”不过是一个荒谬的科幻老调?
本文挑战了科幻作品中常见的“AI必将毁灭人类”的观点,认为AI系统的运行依赖于人类维护的基础设施。
AI 是否比核军备竞赛更危险?
一名离职的 Anthropic 研究员警告称,AI 开发者相信人工智能可能在本十年末导致人类灭绝,并引用了快速进展、自主能力和缺乏安全计划作为原因。