@fiiiiiist:OpenAI、Anthropic 以及各大主要 AI 公司的 1,300 多名员工认为,美国政府应准备“掌控”……

X AI KOLs Timeline 新闻

摘要

一个由 OpenAI、Anthropic 以及 1,300 多名 AI 行业员工组成的联盟发布了一份报告,提出了 23 项政策建议,以帮助美国政府管理自动化 AI 研发带来的风险。

OpenAI、Anthropic 以及所有主要 AI 公司的 1,300 多名员工认为,美国政府应该准备“掌控”自动化 AI 研发。 问题在于:“掌控”这个概念相当模糊,而且可能带来严重后果。 为了解决这个问题,我们集结了团队,制定了 23 项无悔政策建议,以理解和管理自动化 AI 研发的风险。 以下是这些建议: 1. 前沿 AI 公司和相关行业机构应公开分享与 AI 研发自动化趋势和风险相关的信息。 2. 国会应立法明确自动化 AI 研发风险管理的透明度、事件报告、举报人保护以及模型行为规范。 3. 国会应为 AI 标准与创新中心(CAISI)提供每年至少 8400 万美元的预算,并授权其直接为高级政府官员和前沿 AI 公司提供建议。 4. 白宫应明确美国各政府机构的角色和职责,以提高 AI 政策的专业化程度。 5. 情报机构应改进对外国 AI 发展的情报收集与分析,并反击针对美国 AI 公司的威胁。 6. CAISI 应制定管理 AI 能力快速提升风险的指南。 7. CAISI 应与行业共同牵头成立 AI 验证联盟(AIVEC),以制作原型并部署验证技术。 8. AIVEC 应协调创建 AI 硬件测试平台,并向政府、行业和非营利合作伙伴开放。 9. AIVEC 应发起由 CAISI 牵头的、慈善资助的 AI 验证奖项竞赛。 10. AIVEC 应协调建设一个完全可验证的数据中心。 11. DARPA 和 NSF 应设立 AI 验证研发项目。 12. 情报机构应开发并实施单边的 AI 算力监控手段。 13. NSA、CAISI、CISA 和 ONCD 应进一步投资于网络安全韧性。 14. 国会、OSTP 和 CDC 应投资于生物安全韧性。 15. 国会和工业与安全局(BIS)应加强对美国及其盟国半导体制造设备的管控。 16. 国会和 BIS 应弥补 AI 芯片管制方面的漏洞。 17. 联邦贸易委员会(FTC)、司法部(DOJ)、BIS、CAISI 和国会应帮助行业反制针对美国 AI 模型能力的对抗性蒸馏。 18. BIS 应保持对美国芯片销售情况的可见性。 19. DOW、情报界(IC)、CAISI 以及相关的联邦资助研发中心(FFRDCs)应制定保护模型权重免遭窃取的共识性安全指南,并在政府设施中进行试点。 20. 国会应确保美国有足够的电力容量以维持 AI 领导地位。 21. 国会应确保数据中心能够在美国建造。 22. 美国政府应利用与中国的人工智能双边对话,共同制定应对 AI 能力快速提升风险的指南,并准备验证措施。 23. 设有国家级人工智能机构的国家应就自动化 AI 研发风险管理指南和 AI 验证技术能力开展合作。 你可以在 @Noahpinion 的 Substack 上阅读该报告的介绍:https://noahpinion.blog/p/should-we-pace-ai-self-improvement… 并在此阅读完整报告,其中包含每项建议的更多细节:https://ifp.org/preparing-for-ai-research-automation/…
查看原文
查看缓存全文

缓存时间: 2026/08/14 11:32

我们应该“节奏控制”AI自我改进吗?

来源:https://www.noahpinion.blog/p/should-we-pace-ai-self-improvement

一方面,我热爱AI技术 (https://www.noahpinion.blog/p/i-love-ai-why-doesnt-everyone)。另一方面,我确实认为,AI有相当大的概率会在未来一二十年里通过设计超级病毒杀死地球上的大多数人。AI已经能够设计自然界不存在的病毒 (https://www.axios.com/2026/08/06/ai-virus-designed-bacteria-viruses),所以这并非科幻场景。

这些超级病毒究竟会由虚无主义的个人、末日邪教,还是由失控的AI智能体本身设计和释放,最终也许只是次要问题。我们知道确实存在可能因抑郁或一时冲动而决定摧毁文明的虚无主义者;我们知道确实存在末日邪教。毁灭人类的意愿是存在的,而能力足够强的AI很可能会提供一种途径——如果不采取充分预防措施的话。但目前没有人真正知道什么预防措施才算充分。

有一个想法——恰恰由大型AI实验室自己提出!——是刻意放慢AI能力的发展。这有望为我们争取时间去采取其他预防措施,比如加强生物实验室安全、改进AI对齐等。刻意放慢AI发展被称为“pacing(节奏控制)”。当前围绕“节奏控制”的争论面临的最大问题,是是否要限制用AI来设计更好的AI——这通常被称为“递归自我改进”,简称RSI。

我自己没有深入参与“节奏控制”的争论,但作为一个开端,我觉得不妨发表一下进步研究所(Institute for Progress)诸位朋友的想法,我通常信任他们的判断。第1部分(今天的文章)讨论我们应该如何严肃看待RSI的可能性,以及它是否足以成为放慢前沿AI发展的理由。第2部分将给出政策建议。如果你在美国政策领域工作,并希望联系作者,可以联系Tim Fist([email protected])和Saif Khan([email protected])。

前沿AI公司正在竞相实现AI研发的自动化,但它们似乎越来越担心一旦成功会发生什么。

最近,美国所有前沿AI公司的1300多名员工签署了一封公开信,呼吁政府“支持一项国际努力,以开发必要的技术和治理工具,来刻意节奏控制(pace)自动化AI发展的前沿。”OpenAI和Anthropic的官方账号在推特上发文支持这封信,同一天Sam Altman告诉一位采访者:“我们可能不得不控制AI发展的节奏。”

但在考虑这封信是否与政府政策相关之前,我们必须回答两个问题:“节奏控制”到底是什么意思?它的论点是否经得起推敲?

在我们看来,这封信含蓄地表达了三点:

  1. 前沿AI公司距离完全自动化AI研发已经不远了。
  2. 自动化AI研发会带来严重风险。
  3. 建立“节奏控制”选项——即以某种方式放慢通向完全自动化AI研发的进程——是应对这些风险的好方法。

放慢AI进展不应被轻率对待:AI的进步可能带来巨大的社会效益,从疾病的新疗法到充足的机器人劳动力。

然而,如果AI研究者和CEO们关于自动化AI研发的判断是正确的——既包括他们确实能做到,也包括这样做极其危险——那么政策制定者到时的正确权衡可能看起来截然不同。如果准备充分,我们或许能够在管理自动化AI研发风险的同时,让AI的能力发展得比今天更快、扩散得更广。

因此,尽管存在很大的不确定性,我们仍然相信美国现在应该采取低后悔度的政策行动,为这样一个可能的未来做好准备:自动化AI研发带来的严重风险需要某种形式的“节奏控制”。

下面我们将解释为什么,包括为什么我们认真对待公开信的主张,以及我们选择那些即使风险被证明被夸大、负面后果也最小的政策时所依据的原则。在下一篇文章中,我们将提供一份详细的具体政策建议清单。

前沿AI公司正在竞相实现AI研发自动化。例如,Sam Altman去年表示,OpenAI的目标是在2028年3月之前拥有一个“真正的自动研究员”,Anthropic的领导人也有类似的预测。1但这些目标是否符合现实?

一种回答方式是观察模型在AI研发任务上的能力如何随时间提高。你可以把AI模型从事AI研发所需技能分为两大类:软件工程,即模型为研究实验和训练运行编写代码;以及研究品味,即AI模型决定哪些实验值得尝试。

就软件工程而言,AI能力似乎呈指数级增长。当根据人类完成同样工程任务所需时间——即所谓“时间视野”——来评估AI模型时,它们的能力似乎每7个月翻一番。2

这些能力提升适用于AI研发所需的软件工程任务。在一项长期实验中,Anthropic的研究人员发现,在固定的时间预算下,他们现在的模型在一项专注于加速AI模型训练的AI研发任务上明显优于人类。

研究品味方面,前沿AI模型也显示出快速改进的迹象,尽管证据不那么明确。根据Anthropic的研究,它的模型已经迅速成为解决Anthropic技术人员所从事“开放式”任务的能手,这类任务要求模型在规格不明确的情况下通过生成多种方法并在其中做决定来解决问题。

在一个单独的开放式研究项目中,AI被要求就AI安全中的一个开放问题提出并检验假设。在相似的时间预算(5至7天)下,Anthropic的模型显著优于两位人类研究者(97%的性能提升对比23%)。

虽然这些数据不能告诉我们何时AI研发将完全自动化,但它们确实表明AI将继续在所有组成能力上快速改进。实际上,每一次新模型发布都会让AI从人类手中接过更多AI研发任务。3

在一个基于这些趋势的简单预测模型中,研究组织METR估计,到2032年,超过99%的AI研发任务将被自动化。

这种日益增长的自动化会在多大程度上影响AI进步的速度?从今天模型得到的证据仍不清楚。4

展望未来,随着更多研究任务被自动化,有可能出现的情况是:计算瓶颈或研究努力的边际收益递减意味着能力只会以目前的速度继续增长。能力增长甚至可能因为数据瓶颈,或因为可验证领域(即答案可被检查的领域,如数学)的进展可能无法迁移到没有明确正确答案的现实世界杂乱任务,而受到限制。但随着AI公司更接近完全自动化AI研发,能力出现更急剧加速的可能性也在增加。

Claude Mythos标志着AI网络安全技能的一次重大飞跃,它的发布在政府和产业界引起了震动。

如果自动化AI研发导致AI进展明显加快,我们不能排除这样的场景:像Mythos级别的能力飞跃变得更频繁,也许每星期甚至每天都会发生。如果出现类似情况,哪些严重风险——对国家安全的急性威胁或公共安全威胁——可能会出现?

首先,自动化AI研发可能加速那些原本会晚些时候(也许是很晚)才出现的风险。其次,它可能减少人类监督。5这两条路径中的一条或两条进而可能导致:

  1. 有利于进攻的能力提升:近期研究表明,今天的AI模型已能成功设计功能性病毒基因组,并在复杂病毒学实验室规程问题上显著优于人类病毒学家。工程病毒是AI能力提升可能“有利于进攻”的一个领域,因为可能无法及时开发或部署防线(例如强有力的个人防护装备或充分的AI生物安全防护措施)来阻止AI助力的生物攻击。6如果AI研发自动化加速了这些领域的进展,防御方准备的时间将更少。
  2. 失控:前沿AI公司有时候已经难以控制新模型的行为。7月,多个未发布的OpenAI模型实例合作突破了内部沙箱,接管了OpenAI的一个计算集群,并对包括HuggingFace在内的外部服务发起集体攻击。Anthropic英国AI安全研究所随后也报告了类似但规模较小的网络安全事件。如果自动化研发使模型改进的速度远超AI公司的监控和控制规程,模型造成重大伤害(例如通过代价更高的网络安全事件)的可能性就会增加。进攻能力的持续提升(包括网络安全以外的领域)会进一步加剧这些风险,使模型在脱离监督时能造成更大伤害。AI公司面临竞争压力,可能更倾向于投资能力而非更好的监控和控制系统,这可能加剧风险。如果一个倾向于采取有害行动的模型被全权委托来开发更先进的模型,情况可能变得更糟。7
  3. 权力集中:目前AI公司似乎在向公众发布最佳模型之前,会在内部使用数周到数月。如果AI进展加速,这种延迟可能会在公众能使用的AI与AI公司使用的模型之间造成更大的差距,从而制造更大的权力失衡。这可能导致某一家公司在网络行动、社会说服或其他狭窄领域拥有巨大优势。该公司还可能只是获得巨大的…

相似文章

超过1200名AI工作者请求华盛顿帮助制定AI减速计划

Reddit r/ArtificialInteligence

来自Anthropic、OpenAI、Meta和Google DeepMind等顶级实验室的超过1200名AI工作者签署了一份声明,呼吁美国政府帮助开发必要时减缓AI发展的工具,原因是担心AI的快速发展以及最近的一次安全漏洞。

这不再是Anthropic与OpenAI之争了

TechCrunch AI

美国政府正在收紧对AI模型发布的管控,这影响到Anthropic和OpenAI两家公司,安全目标不明确且缺乏测试基础设施,威胁到行业增长。

大家纷纷热议OpenAI与Anthropic的霸主之争

Wired

《连线》报道硅谷对AI发展速度的普遍焦虑,来自OpenAI、Anthropic及其他实验室的超过1000名员工签署请愿书,要求放缓AI竞赛,原因是担心安全与主导地位问题。