问题
摘要
文章概述了超级人工智能的存在风险,警告说如果没有积极的政策响应,当前的人工智能发展可能导致人类灭绝。
暂无内容
查看缓存全文
缓存时间: 2026/08/15 15:40
# 问题所在 - 机器智能研究院
来源:https://intelligence.org/the-problem/
#### 目录
世界领先人工智能公司的既定目标是构建**通用性**足以胜任人类所能做任何事情的AI,从解决理论物理中的难题到巧妙应对社交环境。近期机器学习的进展似乎已使这一目标触手可及。此时,我们难以排除AI在未来一两年内超越任何人类的可能性,而若这一结果仍需二十年以上才能实现,我们将感到相当意外。
MIRI研究科学家目前的观点是:如果超越人类的AI在这十年内开发出来,其结果将是前所未有的灾难。CAIS声明(https://www.safe.ai/work/statement-on-ai-risk)获得了该领域资深研究者的广泛支持,其中指出:
> 缓解AI导致的灭绝风险应与大流行病、核战争等其他社会级风险一样成为全球优先事项。
**我们相信,如果研究人员基于当前领域的技术理解或方法构建任何接近的超级智能AI,其预期结果将是人类灭绝**。
“全球研究实验室目前正在构建可能导致人类灭绝的技术”这一结论理应推动迅速的政策响应。然而,AI发展的迅猛速度让政府和投票公众措手不及。本文旨在让读者快速了解情况,并概述可能避免灾难的政策步骤。
本文关键要点:
- 人类水平的能力并非上限。(https://intelligence.org/the-problem/#1_no_ceiling_at_human-level)
- 超级人工智能极可能表现出目标导向行为。(https://intelligence.org/the-problem/#2_goal-oriented_behavior)
- 超级人工智能极可能追求*错误*的目标。(https://intelligence.org/the-problem/#3_wrong_goals)
- 构建具有错误目标的超级人工智能将是致命危险。(https://intelligence.org/the-problem/#4_lethally_dangerous)
- 灾难可通过足够积极的政策响应避免。(https://intelligence.org/the-problem/#5_policy)
### 1. 人类水平的能力并非上限。
CAIS声明的签署者包括AI领域被引用最多的三位在世科学家:Geoffrey Hinton、Yoshua Bengio和Ilya Sutskever。其中,Hinton曾表示(https://www.ft.com/content/c64592ac-a62f-4e8e-b99b-08c869c83f4b):“如果我为政府提供建议,我会说这些事物在未来20年内消灭人类的概率是10%。我认为这是个合理的数字。”在2024年4月的一次问答中,Hinton(https://youtu.be/PTF5Up1hMhw?si=oY8w3v37EhNu8sbJ&t=2220)表示:“实际上我认为风险超过50%,指存在性威胁。”
AI构成如此极端危险的根本原因在于,其发展不会止步于人类水平的能力。具备人类水平通用性的系统很可能会迅速演变为**超级人工智能**(ASI):在所有能力(包括经济、科学和军事能力)上都显著超越人类的AI。
历史上,当世界找到自动化某项计算任务的方法时,我们通常发现计算机能比人类更好地、更快地、更广泛地执行该任务。这在近期AI于棋盘游戏和蛋白质结构预测方面的进展中尤为明显:AI在达到顶尖人类专业水平之前几乎没有经历过渡期就迅速超越了人类能力。在策略丰富且难以掌握的围棋游戏中,AI在一年内从从未赢过任何职业棋手,到从未输给任何顶尖职业棋手。以具体系统AlphaGo Zero(https://intelligence.org/2017/10/20/alphago/)为例:在三天内,AlphaGo Zero从对围棋一无所知到超越所有人类棋手,且完全没有接触人类对局或策略信息。
在大多数方面,计算机硬件在计算的基本活动上已远超其生物对应物。虽然当前能耗效率较低,但现代晶体管的状态切换速度至少比神经元放电快一千万倍。计算机系统的工作记忆和存储容量也可能远超人脑。当前系统生成文本、艺术、代码等的速度已比人类快几个数量级。当AI能够执行最聪明的人类能完成的全部认知任务时,我们不应期待AI的速度优势(或其他优势)会突然消失。相反,我们应期待超越人类的AI在速度、工作记忆等方面彻底超越人类。
AI的架构大部分是数字化的,使已部署的系统也能快速重新设计和更新。这赋予AI远超人类的自我修改和自我改进能力。这进而可能形成一个反馈循环(I.J. Good的“智能爆炸”),因为AI的自我改进加速并提升了其进一步自我改进的能力。
人类的科学能力对世界产生了巨大影响。然而,我们在核心科学能力(如心算)上远非最优;且人脑的进化并未针对此类工作进行优化。更广泛地说,人类是年轻的物种,进化才刚刚开始探索通用智能心智的设计空间——且这些努力因人类生物学的偶然特征而受阻。一个例子是人类产道只能在一定程度上扩大,否则会影响双足行走;这限制了人类进化更大大脑的能力。为AI增加十倍算力有时只需连接十倍数量的GPU。这有时并非字面意义上的简单,但比扩大人类产道容易得多。
所有这些使得AI长期停滞在最佳人类科学家和工程师的智力水平的可能性大大降低。
我们不应将AI视为“人类水平”,而应期待弱AI在不同领域表现出次人类和超人类能力的奇特混合,并期待强AI远超人类能力范围。
越来越多的科学家对超级人工智能发出警告,且人数迅速增长。引用Anthropic的Dario Amodei最近一次采访(https://youtu.be/Gi_t3v53XRU?si=2hG5OozeBXYJeQu6&t=3748):
> **AMODEI:**是的,我认为ASL-3(AI安全等级3)很可能在今年或明年发生。我认为ASL-4——
**KLEIN:**哦,天啊。
**AMODEI:**不,不,我告诉过你。我相信指数增长。我认为ASL-4可能在2025年至2028年间的任何时间发生。
**KLEIN:**那真是很快。
**AMODEI:**是的,不,不,我确实在谈论近期未来。
Anthropic将ASL-4(https://www-cdn.anthropic.com/1adf000c8f675958c2ee23805d91aaade1cd4613/responsible-scaling-policy.pdf)与“明确有能力在现实世界中复制、积累资源并长期避免被关闭”的AI阈值,以及“AI模型已成为*主要国家在特定领域的安全风险主要来源*”的情景相关联。
在这些广泛担忧的背景下,美国参议院成员召集了关于“风险、对齐及防范末日情景”的跨党派AI洞察论坛(https://intelligence.org/2023/12/06/written-statement-of-miri-ceo-malo-bourgon-to-the-ai-insight-forum/),联合国秘书长安东尼奥·古特雷斯承认(https://www.youtube.com/watch?v=ktFF2dSH3oU&t=38s)研究界一直在大声疾呼并“宣布AI对人类构成存在性威胁”。在美国国务院委托的一份报告中,Gladstone AI警告(https://www.cnn.com/2024/03/12/business/artificial-intelligence-ai-report-extinction/index.html),通用AI系统失控“可能对人类物种构成灭绝级威胁”。
如果政府不干预停止该技术的开发,我们相信人类灭绝将是默认结果。若为在缺乏积极近期政策响应的情况下灭绝的可能性赋予一个数值,MIRI研究领导层会给出**超过90%**。
本文其余部分将聚焦于这一威胁如何显现及其原因,以及我们认为需要哪些干预措施。
### 2. 超级人工智能极可能表现出目标导向行为。
目标导向行为具有经济价值(https://gwern.net/tool-ai),领先的AI公司正明确尝试在其模型中实现目标导向行为(https://www.bloomberg.com/news/videos/2024-05-08/google-deepmind-ceo-on-drug-discovery-hype-isomorphic-video)。
然而,更深层的原因在于,解决长时间跨度问题本质上等同于目标导向行为。这是超级人工智能局势对我们显得严峻的关键原因。
重要的是,AI可以“表现出目标导向行为”而不必具备人类般的欲望、偏好或情感。表现出目标导向行为仅意味着AI**持续以产生特定长期结果的方式改变世界**。
我们可以在现有系统(如顶级国际象棋AI Stockfish)中观察到目标导向行为:
- *追求胜利*。Stockfish有明确目标,并持续不懈地追求这一目标。其他棋手的任何行为都无法使Stockfish放弃此目标;没有任何互动会促使Stockfish以公平、怜悯或其他目标的名义“对对手宽容”。(在国际象棋AI中这相当明显,但值得明确指出,因为当AI能表现更通用的人类行为、被要求模仿人类等时,更容易将其拟人化并假设其具有人类目标。)
- *战略与战术灵活性*。尽管目标僵化,Stockfish在战略和战术层面极其灵活。干扰Stockfish的计划或设置障碍,Stockfish会立即调整计划以巧妙应对障碍。
- *具有远见与创造性的规划*。Stockfish会*预判*可能的未来障碍(和机遇),并构建执行复杂的长期计划,包括精彩的虚招和创新策略,以最大化获胜概率。
注意到ChatGPT等系统似乎不太注重目标的观察者,也常注意到ChatGPT在长期任务(如“撰写包含大量伏笔的长篇系列书籍”或“大规模工程项目”)上表现不佳。他们可能未意识到这两种观察是相关的。
在一个足够大且充满意外、不断打乱现有计划的世界中,完成长期复杂任务的方法是:(a)拥有相对强大且通用的技能来预判和适应计划障碍;(b)具备顽强追求目标、不分散注意力或失去动力的倾向——就像Stockfish全神贯注地坚持追求胜利。
对AI能够娴熟实现长期目标的需求很高,随着AI在这方面变得更好,我们可以期待AI系统相应地显得更具目标导向。例如,我们可以看到OpenAI o1比之前的LLM进行更多长期思考和规划,实际上也表现出比之前模型更顽强的行为(https://www.transformernews.ai/p/openai-o1-alignment-faking)。
目标导向性对于超级人工智能*不是*充分条件(否则Stockfish将是超级智能),但它似乎非常接近*必要条件*:AI需要具备战略制定、适应、预判障碍等心智机制,并且需要具备愿意将这些机制广泛应用于各类任务的倾向,以便在复杂的长期活动中可靠成功。
因此,作为强默认,超越人类的AI很可能顽固地重新导向特定目标,无论现实抛出什么意外。如果AI的目标是好的,这是好事;但如果目标不符合开发者意图,则极其危险:
如果AI的目标是将球推上山坡,那么从AI的角度看,阻碍其达成目标的人类与墙同属“障碍”。使AI对长时间跨度现实世界任务有用的相同机制——面对环境中各种阻碍仍顽强追求目标——也会使AI希望阻止人类干扰其工作。当AI不如人类聪明时,这可能只是小麻烦;但当AI比人类更聪明时,就会变成巨大问题。
从AI的角度看,*修改AI的目标*也算作障碍。如果AI正在优化一个目标,而人类试图改变AI以优化新目标,除非新目标也能最大化旧目标,否则优化目标1的AI会希望避免被转变为优化目标2的AI,因为这种结果在“这是确保目标1最大化的最佳方式吗?”指标上得分很低。这意味着迭代改进AI并不总是可行的选项:如果AI在拥有正确目标之前就变得强大,它会希望颠覆改变其目标的尝试,因为从AI角度看任何目标改变都是不利的。
出于同样原因,*关闭AI*也算作AI目标的障碍。对于AI的几乎所有目标,AI运行时目标更可能实现,以便其能继续为相关目标工作。AI不需要具备人类那样的自我保存本能;只要AI具备高度能力和*具备*目标导向性就足够了。任何可能干扰系统未来追求目标的事物都可能被视为威胁。
权力、影响力和资源能促进大多数AI目标的实现。正如我们将在“构建具有错误目标的超级人工智能将是致命危险(https://intelligence.org/the-problem/#4_lethally_dangerous)”一节中讨论的,避免潜在障碍、最大化目标实现机会的最佳方式通常是最大化对未来的权力和影响力、控制尽可能多的资源等。这将使强大的目标导向系统与人类在资源和控制权上直接冲突。
所有这些表明,开发者必须稳健地将正确目标植入超级人工智能。然而,在当前技术范式下,成功实现这一目标的前景似乎极为渺茫。
### 3. 超级人工智能极可能追求错误的目标。
开发者不太可能赋予超级人工智能对有价值目标的深刻而持久的关注。经过二十年对该问题技术层面的研究,我们的观点是,该领域在实践中远未达到此目标。
超级人工智能可能表现出非预期目标的原因包括:
- 在现代机器学习中,AI是“培育”而非设计出来的。
- 当前AI范式不适合稳健地建立...
相似文章
AI行业最新末日警告的真相
文章分析了AI行业关于存在风险的激烈争论,起因于一名研究员从Anthropic辞职,并声称AI极有可能导致人类灭绝,同时质疑了这些说法的可信度和影响。
America’s Superintelligence Dilemma: How to Avoid an AI Catastrophe
Foreign Affairs analysis of U.S. policy options for handling artificial superintelligence, weighing supremacy, shared development, suppression, and prudent hedging amid rising AI risks and geopolitical competition.
AI研究人员发布视频警告超级智能'完全如其名般危险'
来自OpenAI、Google DeepMind和Anthropic的AI研究人员发布访谈,警告超级智能可能导致人类灭绝,并讨论控制此类系统的挑战。
AI是存在风险……但我们还是要构建它。
本文批评了那些声称AI存在存在性风险却竞相构建的AI公司,主张进行负责任的发展,避免恐慌或基于恐惧的公关。
你究竟认为AI会如何实际执行毁灭全人类的行动?
这篇文章批判了一个涉及超级智能AI的模糊末日情景,认为它缺乏具体细节,本质上是在制造关于AI安全的恐慌。