人工智能灭绝风险的德雷克方程?

Reddit r/ArtificialInteligence 新闻

摘要

本文提出了一个受德雷克方程启发的框架,将人工智能灭绝风险分解为条件概率,从而使得对各种结果的讨论和估算更加精确。

最近有很多关于先进人工智能最终可能导致人类灭绝的概率的讨论。根据你问的人不同,答案从几乎为零到令人不安的高数字不等。但直接问某人‘人工智能导致人类灭绝的概率是多少?’似乎几乎毫无意义。我们从多个来源读到10%。我甚至不知道我们是否有经验数据来估计这样的概率。因此我想到,一个更好的方法可能是类似于天文学中我们有的德雷克方程:将问题分解为一系列条件概率,转而讨论这些。例如,定义X为2100年前因失控先进人工智能导致的人类灭绝:P(X)=P(A) P(D|A) P(M|A,D) P(E|A,D,M) P(C|A,D,M,E) P(X|C) 其中:A:AI达到战略性的超人类能力。D:我们部署它,赋予足够的自主权和现实世界访问权限,使其变得危险。M:它发展出与人类利益严重不一致的情况。E:它成功逃脱、规避或击败人类控制机制。C:它获得持久的战略控制,人类无法恢复。X:这种失控确实导致人类灭绝,而不是一些较小的灾难、共存或人类能动性的永久丧失。作为一次故意粗略的初步尝试,假设:P(A)=0.8, P(D|A)=0.7, P(M|A,D)=0.3, P(E|A,D,M)=0.5, P(C|A,D,M,E)=0.5 和 P(X|C)=0.4 那么:P(X)=0.8 x 0.7 x 0.3 x 0.5 x 0.5 x 0.4 或大约:P(X) ~ 1.7% 我并非声称人工智能灭绝的概率是1.7%。上面的数字是有意为之的可争议的。这正是重点。与其争论 P(X) 是0.1%、5%还是50%,我们可以问更具体的问题:超级人工智能的可能性有多大?我们赋予它实质自主权的可能性有多大?严重不一致的可能性有多大?如果不一致,它成功逃避我们控制的可能性有多大?如果它逃脱控制,它实际获得战略主导地位的可能性有多大?即便如此,为什么战略主导地位必然意味着灭绝,而不是边缘化、人类遏制、共存或其他结果?每个问题似乎都比‘人工智能会杀死我们所有人吗?’更可操作。这也使得分歧更有信息量。一个 P(X) 为0.01%的人和一个 P(X) 为20%的人可能根本上并不在人工智能方面存在分歧。他们可能只是在因果链中的一两个环节上赋予截然不同的概率。
查看原文

相似文章

问题

Hacker News Top

文章概述了超级人工智能的存在风险,警告说如果没有积极的政策响应,当前的人工智能发展可能导致人类灭绝。

AI行业最新末日警告的真相

TechCrunch AI

文章分析了AI行业关于存在风险的激烈争论,起因于一名研究员从Anthropic辞职,并声称AI极有可能导致人类灭绝,同时质疑了这些说法的可信度和影响。