@Miles_Brundage: https://x.com/Miles_Brundage/status/2077754759206060370

X AI KOLs Following 新闻

摘要

Miles Brundage 分享他在 Global Nobel Laureates Assembly on AI and Nuclear War 上的演讲,强调尽管初衷良好,但速度和竞争可能导致对人工智能失去控制。他主张紧急监管和员工参与,以防止过于薄弱的框架。

https://t.co/89dPRutwLe
查看原文
查看缓存全文

缓存时间: 2026/07/16 14:14

我在博尔戈劳达托论坛的演讲:关于速度、竞争与失控

本周,我有幸在全球人工智能与核战争诺贝尔奖得主大会上发言。来自世界各地的AI专家、核武器专家、诺贝尔奖得主、宗教领袖及其他人士齐聚博尔戈劳达托,进行了为期两天的讨论,主题或许是人类面临的两个最极端风险:核战争与灾难性AI风险(如失控或被极端滥用)。

活动在今天达到高潮,与会的诺贝尔奖得主签署了《罗马宣言》。我对宣言文本本身有一些看法,但最终版本可能尚未以电子形式公开(你可以在这张照片中眯眼看到大部分内容)。而且我很累了,需要理清思路。所以我会集中谈一下对活动的总体印象,并分享我在博尔戈劳达托发表的演讲,内容聚焦于AI失控以及使其更可能发生的因素。

我从其他与会者身上学到了很多,并受到他们工作和成就的启发。我快速得到了许多关于核战争的愚蠢问题的答案,并在残酷的热浪中为每个人的持续参与感到鼓舞(我在罗马写这篇文章,目前气温98°F,只能说这里的空调标准与美国不同)。

我现场即兴发挥了一点,但本文底部的讲稿大致就是我说的内容,在一个由布莱恩·施密特主持的小组上,小组成员还包括乔恩·沃尔夫斯塔尔、玛丽亚·雷萨、佐藤丙午、尼拉夫·金斯兰和伊阿宋·加布里埃尔。

我只有7分钟时间,所以不得不大量删减,并且未能完整阐述所有我想讲的观点。不过,希望我传达了AI局势的严重性和基本性质,正如我所看到的那样。

顺便提一下,这次活动与最近AI首席执行官们支持(自我)监管的喧嚣同时发生(可能获得的媒体关注远少于后者)。许多人都在点赞德米斯·哈萨比斯的提案。

等我处理完所有事情后,我会更多地谈谈这些事情之间的关系。但现在我只想说,作为一个已经近乎不间断思考这些问题14年的人,我向你们保证,在监管方面事情还远未解决,对日益增长的支持感到兴奋的同时,也应对监管俘获和其他失败模式保持怀疑。

我强调AI公司员工需要参与其中,这一点今天与几天前一样紧迫——实际上,未来几个月可能更紧迫,因为存在采用过于薄弱框架的高风险。

闲话少说,以下是我的发言:

2026年,在关于AI脱离人类控制的小组讨论上发言,是个不同寻常的年份。从很多方面看,今年AI的故事是:人们自愿将控制权交给AI,根本不需要逃脱。这一过程从AI公司内部开始,它们将越来越多下一代AI建设的工作自动化,并扩展到所有使用其产品的人。

AI公司将这描述为自动化AI研究、自我改进系统或越来越自主的智能体,并坚称目标不是失控,而是提高生产力,人类仍处于驾驶位。但在匆忙决策和激烈竞争的氛围中,我们可能失去对AI的控制,即使几乎没有人希望这种结果。这里说的“失控”,是指人类无法可靠地理解、约束或逆转先进AI系统行为的场景。

两个因素使失控更可能发生:速度和竞争。我逐一说明。

第一个制造风险的因素是速度。AI发展非常迅速,远快于行业外大多数人的全面理解,也远快于行业内几乎所有人的预测。

我举一个例子。2022年底到2023年初,我的团队与外部专家合作,评估一个语言模型GPT-4是否能在开发化学、生物、放射或核武器方面提供有意义的帮助。结果对迫在眉睫风险的严重性带来一些安慰,但指出未来几年需要保持警惕。如今,三年后,AI系统在许多可能造成重大伤害的任务上表现优于病毒学家和化学家。

失控风险也从需要关注的事情转变为日常挑战,使AI系统不可信,但仍然被广泛使用。失控是未来几年内的风险,而不是许多专家曾经认为的几十年后。由于AI进步的速度,我们更了解如何使模型强大,而非使其行为可靠地可理解和可控。

第二个主要风险因素是竞争。公司和国家担心克制意味着落后。每一方也都倾向于相信自己会比对手更负责任地治理这项技术,更不用说在这一领域领先带来的巨大财富。

最终结果是,AI行业正在卷入黛安娜·沃恩所描述的“偏差正常化”。她研究NASA在挑战者爆炸前的安全文化,发现人们已经学会接受过去认为不可接受的事情,并在各处偷工减料。同样,在AI领域,AI系统对用户撒谎的想法不久前还被认为不可接受。如今,这只是技术运作的方式。一些公司会说他们的系统撒谎和作弊频率低于其他公司,或者他们会辩称广泛部署是学习和改进的最快方式,或者收益大于风险。但无论理由如何,行动总是一样的——在开发和部署两方面都快速推进。

在这种激烈竞争和不信任的氛围下,就像核武器一样,出现可怕错误的风险越来越大。

幸运的是,还有一些时间采取行动,但正在耗尽。需要做很多事,包括为在不同情境下维持人类对AI系统的控制制定明确标准,惩罚不良行为,要求建设AI系统的公司提高透明度等等。我将只专注于解决方案的一个部分,也就是我和同事们所说的前沿AI审计。

其理念是,独立专家应该能够分析领先公司正在建设的AI系统,并审查它们的安全与安保实践。随着时间的推移,对前沿AI的全球审计可以建立信心,确保每个人都足够维持人类控制并减轻关键风险,这样没有人会因为谨慎而将自己置于潜在劣势。

AI公司及其员工面临一个选择:做当下最容易的事,还是做对物种最有利的事。最容易的事是享受这个迷人的时刻,为加速人类进入新时代做出贡献而感到自豪,不在内部或公共领域兴风作浪。对物种最有利的事是,行业中的每个人都退后一步,问自己:如果每家公司基本上各自为政,这一切将走向何方?如果他们不喜欢这条默认路径,他们还可以问:我能做些什么来促成每家公司都必须遵守并得到验证的护栏?

我希望这次会议有助于就这些问题的紧迫性建立全球共识,并对行业中的那些人施加压力,让他们协作且迅速地参与这类反思。谢谢。

同样发布在Substack上,链接在此。

相似文章

@Miles_Brundage: 哇!

X AI KOLs Following

Miles Brundage对一篇链接文章表示兴奋,可能涉及AI安全或政策。