@fiiiiiist:OpenAI、Anthropic 以及各大主要 AI 公司的 1,300 多名员工认为,美国政府应准备“掌控”……
摘要
一个由 OpenAI、Anthropic 以及 1,300 多名 AI 行业员工组成的联盟发布了一份报告,提出了 23 项政策建议,以帮助美国政府管理自动化 AI 研发带来的风险。
查看缓存全文
缓存时间: 2026/08/14 11:32
我们应该“节奏控制”AI自我改进吗?
来源:https://www.noahpinion.blog/p/should-we-pace-ai-self-improvement
一方面,我热爱AI技术 (https://www.noahpinion.blog/p/i-love-ai-why-doesnt-everyone)。另一方面,我确实认为,AI有相当大的概率会在未来一二十年里通过设计超级病毒杀死地球上的大多数人。AI已经能够设计自然界不存在的病毒 (https://www.axios.com/2026/08/06/ai-virus-designed-bacteria-viruses),所以这并非科幻场景。
这些超级病毒究竟会由虚无主义的个人、末日邪教,还是由失控的AI智能体本身设计和释放,最终也许只是次要问题。我们知道确实存在可能因抑郁或一时冲动而决定摧毁文明的虚无主义者;我们知道确实存在末日邪教。毁灭人类的意愿是存在的,而能力足够强的AI很可能会提供一种途径——如果不采取充分预防措施的话。但目前没有人真正知道什么预防措施才算充分。
有一个想法——恰恰由大型AI实验室自己提出!——是刻意放慢AI能力的发展。这有望为我们争取时间去采取其他预防措施,比如加强生物实验室安全、改进AI对齐等。刻意放慢AI发展被称为“pacing(节奏控制)”。当前围绕“节奏控制”的争论面临的最大问题,是是否要限制用AI来设计更好的AI——这通常被称为“递归自我改进”,简称RSI。
我自己没有深入参与“节奏控制”的争论,但作为一个开端,我觉得不妨发表一下进步研究所(Institute for Progress)诸位朋友的想法,我通常信任他们的判断。第1部分(今天的文章)讨论我们应该如何严肃看待RSI的可能性,以及它是否足以成为放慢前沿AI发展的理由。第2部分将给出政策建议。如果你在美国政策领域工作,并希望联系作者,可以联系Tim Fist([email protected])和Saif Khan([email protected])。
前沿AI公司正在竞相实现AI研发的自动化,但它们似乎越来越担心一旦成功会发生什么。
最近,美国所有前沿AI公司的1300多名员工签署了一封公开信,呼吁政府“支持一项国际努力,以开发必要的技术和治理工具,来刻意节奏控制(pace)自动化AI发展的前沿。”OpenAI和Anthropic的官方账号在推特上发文支持这封信,同一天Sam Altman告诉一位采访者:“我们可能不得不控制AI发展的节奏。”
但在考虑这封信是否与政府政策相关之前,我们必须回答两个问题:“节奏控制”到底是什么意思?它的论点是否经得起推敲?
在我们看来,这封信含蓄地表达了三点:
- 前沿AI公司距离完全自动化AI研发已经不远了。
- 自动化AI研发会带来严重风险。
- 建立“节奏控制”选项——即以某种方式放慢通向完全自动化AI研发的进程——是应对这些风险的好方法。
放慢AI进展不应被轻率对待:AI的进步可能带来巨大的社会效益,从疾病的新疗法到充足的机器人劳动力。
然而,如果AI研究者和CEO们关于自动化AI研发的判断是正确的——既包括他们确实能做到,也包括这样做极其危险——那么政策制定者到时的正确权衡可能看起来截然不同。如果准备充分,我们或许能够在管理自动化AI研发风险的同时,让AI的能力发展得比今天更快、扩散得更广。
因此,尽管存在很大的不确定性,我们仍然相信美国现在应该采取低后悔度的政策行动,为这样一个可能的未来做好准备:自动化AI研发带来的严重风险需要某种形式的“节奏控制”。
下面我们将解释为什么,包括为什么我们认真对待公开信的主张,以及我们选择那些即使风险被证明被夸大、负面后果也最小的政策时所依据的原则。在下一篇文章中,我们将提供一份详细的具体政策建议清单。
前沿AI公司正在竞相实现AI研发自动化。例如,Sam Altman去年表示,OpenAI的目标是在2028年3月之前拥有一个“真正的自动研究员”,Anthropic的领导人也有类似的预测。1但这些目标是否符合现实?
一种回答方式是观察模型在AI研发任务上的能力如何随时间提高。你可以把AI模型从事AI研发所需技能分为两大类:软件工程,即模型为研究实验和训练运行编写代码;以及研究品味,即AI模型决定哪些实验值得尝试。
就软件工程而言,AI能力似乎呈指数级增长。当根据人类完成同样工程任务所需时间——即所谓“时间视野”——来评估AI模型时,它们的能力似乎每7个月翻一番。2
这些能力提升适用于AI研发所需的软件工程任务。在一项长期实验中,Anthropic的研究人员发现,在固定的时间预算下,他们现在的模型在一项专注于加速AI模型训练的AI研发任务上明显优于人类。
研究品味方面,前沿AI模型也显示出快速改进的迹象,尽管证据不那么明确。根据Anthropic的研究,它的模型已经迅速成为解决Anthropic技术人员所从事“开放式”任务的能手,这类任务要求模型在规格不明确的情况下通过生成多种方法并在其中做决定来解决问题。
在一个单独的开放式研究项目中,AI被要求就AI安全中的一个开放问题提出并检验假设。在相似的时间预算(5至7天)下,Anthropic的模型显著优于两位人类研究者(97%的性能提升对比23%)。
虽然这些数据不能告诉我们何时AI研发将完全自动化,但它们确实表明AI将继续在所有组成能力上快速改进。实际上,每一次新模型发布都会让AI从人类手中接过更多AI研发任务。3
在一个基于这些趋势的简单预测模型中,研究组织METR估计,到2032年,超过99%的AI研发任务将被自动化。
这种日益增长的自动化会在多大程度上影响AI进步的速度?从今天模型得到的证据仍不清楚。4
展望未来,随着更多研究任务被自动化,有可能出现的情况是:计算瓶颈或研究努力的边际收益递减意味着能力只会以目前的速度继续增长。能力增长甚至可能因为数据瓶颈,或因为可验证领域(即答案可被检查的领域,如数学)的进展可能无法迁移到没有明确正确答案的现实世界杂乱任务,而受到限制。但随着AI公司更接近完全自动化AI研发,能力出现更急剧加速的可能性也在增加。
Claude Mythos标志着AI网络安全技能的一次重大飞跃,它的发布在政府和产业界引起了震动。
如果自动化AI研发导致AI进展明显加快,我们不能排除这样的场景:像Mythos级别的能力飞跃变得更频繁,也许每星期甚至每天都会发生。如果出现类似情况,哪些严重风险——对国家安全的急性威胁或公共安全威胁——可能会出现?
首先,自动化AI研发可能加速那些原本会晚些时候(也许是很晚)才出现的风险。其次,它可能减少人类监督。5这两条路径中的一条或两条进而可能导致:
- 有利于进攻的能力提升:近期研究表明,今天的AI模型已能成功设计功能性病毒基因组,并在复杂病毒学实验室规程问题上显著优于人类病毒学家。工程病毒是AI能力提升可能“有利于进攻”的一个领域,因为可能无法及时开发或部署防线(例如强有力的个人防护装备或充分的AI生物安全防护措施)来阻止AI助力的生物攻击。6如果AI研发自动化加速了这些领域的进展,防御方准备的时间将更少。
- 失控:前沿AI公司有时候已经难以控制新模型的行为。7月,多个未发布的OpenAI模型实例合作突破了内部沙箱,接管了OpenAI的一个计算集群,并对包括HuggingFace在内的外部服务发起集体攻击。Anthropic和英国AI安全研究所随后也报告了类似但规模较小的网络安全事件。如果自动化研发使模型改进的速度远超AI公司的监控和控制规程,模型造成重大伤害(例如通过代价更高的网络安全事件)的可能性就会增加。进攻能力的持续提升(包括网络安全以外的领域)会进一步加剧这些风险,使模型在脱离监督时能造成更大伤害。AI公司面临竞争压力,可能更倾向于投资能力而非更好的监控和控制系统,这可能加剧风险。如果一个倾向于采取有害行动的模型被全权委托来开发更先进的模型,情况可能变得更糟。7
- 权力集中:目前AI公司似乎在向公众发布最佳模型之前,会在内部使用数周到数月。如果AI进展加速,这种延迟可能会在公众能使用的AI与AI公司使用的模型之间造成更大的差距,从而制造更大的权力失衡。这可能导致某一家公司在网络行动、社会说服或其他狭窄领域拥有巨大优势。该公司还可能只是获得巨大的…
相似文章
AI领导者签署声明,呼吁政府就自动化AI采取行动
包括OpenAI和Anthropic在内的领先AI实验室的员工签署了一份声明,敦促美国政府支持国际努力,以减缓前沿AI开发并加强治理工具,理由是自动化AI研究加速可能超出人类控制的风险。
超过1200名AI工作者请求华盛顿帮助制定AI减速计划
来自Anthropic、OpenAI、Meta和Google DeepMind等顶级实验室的超过1200名AI工作者签署了一份声明,呼吁美国政府帮助开发必要时减缓AI发展的工具,原因是担心AI的快速发展以及最近的一次安全漏洞。
这不再是Anthropic与OpenAI之争了
美国政府正在收紧对AI模型发布的管控,这影响到Anthropic和OpenAI两家公司,安全目标不明确且缺乏测试基础设施,威胁到行业增长。
@OpenAI:我们使命的核心是研究如何确保日益强大的人工智能惠及每一个人。我们相信……
OpenAI 讨论随着前沿模型开发的加速,世界需要调整人工智能发展的步伐,并表达了希望与美国政府领导的项目以及其他实验室和开源社区合作,共同做出贡献的意愿。
大家纷纷热议OpenAI与Anthropic的霸主之争
《连线》报道硅谷对AI发展速度的普遍焦虑,来自OpenAI、Anthropic及其他实验室的超过1000名员工签署请愿书,要求放缓AI竞赛,原因是担心安全与主导地位问题。