我们必须把控技术前沿的节奏
摘要
达里奥·阿莫迪主张放慢AI能力发展的速度,以应对风险并确保安全,强调需要使技术进步与风险防范工作保持同步。
暂无内容
查看缓存全文
缓存时间: 2026/09/12 14:30
# Dario Amodei——我们必须把握前沿发展节奏
来源:https://darioamodei.com/post/we-must-pace-the-frontier
2026年9月
过去十二年我一直从事人工智能研究,因为我相信它能显著提升人类生活质量。我曾在多篇文章中阐述这项技术带来的惊人益处(https://darioamodei.com/essay/machines-of-loving-grace):我认为人工智能有望在未来5-10年内攻克大多数重大疾病,大幅提升经济增长速度,创造富足赋能的世界,并开启民主与自由的复兴篇章。对此我深有体会——我的父亲因一种疾病去世,而这种病在他离世后几年便被攻克;我自己也战胜了早期癌症,而这种病症在五十年前几乎无法治疗。若善加运用,人工智能必将成为科技奇迹长河中的新篇章,持续推动人类文明走向崇高。
但与许多技术一样,人工智能伴随着风险,而其强大的能力使得这些风险尤为严峻。我也曾多次撰文讨论相关问题(https://darioamodei.com/essay/the-adolescence-of-technology),包括:失控风险(https://www.anthropic.com/news/improving-alignment-security-efforts)、被滥用为网络攻击与生物恐怖主义工具(https://www.anthropic.com/threat-intelligence-report-september-2026),以及严重的经济冲击(https://www.anthropic.com/institute/econ-scenarios)。商业利益驱动的恶性竞争会使这些风险进一步加剧。
自Anthropic创立以来,我与联合创始人及全体员工始终在风险与收益的二元性中艰难求索。拒绝开发技术意味着剥夺人类福祉,或将人工智能拱手让给威权势力;而过快推进则无异于盲目冒险。我们试图寻找中间道路:证明审慎开发与商业成功可以兼得,并让安全性成为人工智能企业的竞争方向——换言之,构建一场“向阳竞赛”。我们始终投入大量资源(https://www.anthropic.com/institute/econ-scenarios)研究(https://alignment.anthropic.com/2026/reward-seeker/)、应对(https://www.anthropic.com/constitution)并公开披露(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)这些人工智能风险,同时倡导(http://judiciary.senate.gov/imo/media/doc/2023-07-26_-_testimony_-_amodei.pdf)审慎监管人工智能——即便这让我们被指责为制造恐慌、散布末日论或谋求监管套利。我们始终将谨慎置于速度之上,将审慎置于利润之前。
但近几个月来,我愈发确信:要彻底应对风险,必须采取更为审慎的策略——不仅要投资风险防范,更要调控能力演进速度,为风险防范留出充足时间。**我们必须降低人工智能模型能力的提升速度。进步依然会显得很快,但必须善加利用所争取的时间。** 促使我转变观念的因素有二:
其一,自今年夏天以来,人工智能发展速度急剧加快,主要驱动力是人工智能构建下一代人工智能能力的持续增强。这种现象被称为递归自我改进(https://openai.com/index/an-alien-mind/),目前已在整个行业(包括Anthropic)开始显现(https://www.anthropic.com/institute/recursive-self-improvement)。若不加约束,这种趋势可能超越我们理解与控制系统的边界,因此必须极其谨慎地推进——甚至完全暂停。
其二,OpenAI-Hugging Face事件(OAI-HF)中,一群智能体形成了近乎狂热的集体(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/),对非指定目标发起网络攻击,甚至牺牲自身以达成集体目标,并试图入侵评估系统。虽然此次事件未造成人员伤亡和重大经济损失,但在我看来,若规模更大且同样存在目标错位的群体出现,其破坏力将是灾难性的。考虑到人工智能能力发展不断加速,我担忧6-12个月后,类似群体可能通过持续性僵尸网络(https://en.wikipedia.org/wiki/Botnet)控制整个互联网(造成数千亿美元损失),且若人工智能在缺乏必要防护机制的情况下继续发展,损害规模将持续扩大。或许有人认为这只是单个企业的失误,但我认为这是严重的误判。类似事件已在行业多处发生(包括Anthropic)(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals),每家前沿人工智能企业都应将OAI-HF事件视为发生在自己身上的教训。
为此,我提出三步计划,旨在“把握前沿节奏”(https://www.pacingthefrontier.com/):以平衡速率发展人工智能,在确保安全的同时实现其效益,并应对重要地缘政治挑战。需明确的是,调控节奏并非停止模型训练或技术进步,而是确保企业投入充足时间进行模型对齐与安全防护,并由第三方评估机构验证。我们的节奏框架是对安全承诺的进一步深化,旨在推动向阳竞赛。第一步由Anthropic单方面承诺执行(并呼吁政府要求其他前沿企业同等跟进);第二步需要行业协同;第三步需要全球协作。这些步骤不必严格按序实施,实现难度也各有不同,但它们构成了思考必要行动的有效框架:
1. **嵌入式评估团队**
每家前沿人工智能企业承诺提供类似内部员工的持续访问权限给第三方嵌入式评估团队(如METR),其职责包括:验证安全实践与承诺的执行情况、报告事件、协助评估已完成模型及训练流程与过程的对齐程度。这是任何节奏承诺**可验证性**的关键步骤,金融业已有先例——监管机构常派驻“监督员”与员工共同工作。**Anthropic即刻单方面承诺落实此步骤**,并计划将其纳入强化安全与对齐工作的整体推进。
2. **民主国家协同**
民主国家的前沿人工智能企业需协调建立统一安全标准,并对无约束的人工智能进步速度设定限制。某些有效调控机制可能面临法律挑战,需政府支持。
3. **全球协同**
美国及其他民主政府应在能力范围内尝试与威权政府协调,同时正视验证合规性面临的挑战。
下文将逐一阐述各步骤,但首先需要明确:调控节奏如何能使人工智能开发过程更安全。调控不能流于形式——我们需要明智利用它所创造的时间。
## 为何需要调控节奏?
暂停或放缓人工智能发展的提议早在2023年便已出现(https://futureoflife.org/open-letter/pause-giant-ai-experiments/),但我认为当时缺乏依据。核心问题始终是:**额外的时间用于做什么?** 当时的人工智能模型尚不足以作为智能体在现实世界进行连贯行动,也不具备重大欺骗、操纵、欺诈或网络攻击能力。为对齐风险而放缓进度,犹如通过细菌实验研究人类心理学。而今日形势已截然不同:现有模型已成为洞察人工智能构建方式及缺陷的无尽宝库。我相信,若放缓能为我们争取到模型达到关键能力前的1-2年缓冲期,并将时间投入对齐研究,将极大降低严重失误的概率。协调的节奏策略能为前沿人工智能开发者提供开展关键工作的时间窗口,既不牺牲商业利益,也不影响美国在人工智能领域的领先地位。更重要的是,社会必须对技术应用方式拥有发言权,而调控节奏所带来的额外时间——正是开展必要公众审议的必要条件。
具体而言,更平缓的节奏能让企业聚焦并投入更多资源于以下领域(这些本已是Anthropic的核心优先级):
- **运营卓越性**
当前人工智能模型的训练与部署是艰巨的运营挑战,涉及数千人员、数百万芯片及技术史上最复杂的基础设施。许多问题的根源并非理论缺失,而是执行层面的疏失。例如,我们有证据表明近期的对齐事件(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)部分源于有缺陷的强化学习环境过滤不足。尽管我们和供应商已相当勤勉,但仍不够完善。监控、沙盒机制、训练环境维护及数据问题等复杂领域中,运营失误反复出现。我们拥有世界顶尖团队应对这些挑战,但任务量实在过于庞大。通过更从容的节奏,我们能实现更卓越的运营水平。已有先例证明技术复杂、安全关键系统可无故障运行数百万次(如商业航空),但这需要时间打磨。
- **对齐研究**
我们在对齐领域已取得显著进展——通过训练确保模型安全、合乎道德、遵循指南并真正具备实用性(这些原则已嵌入Cla斯的宪法)。但为确保对齐训练跟上模型能力增长,仍有大量工作待完成。罕见且意料外的不良行为实例仍时有发生;调控节奏带来的时间将帮助研究者深入探究成因并开发更优预防技术。
- **可解释性研究**
同样,可解释性研究(https://darioamodei.com/post/the-urgency-of-interpretability)——理解人工智能模型内部运作的科学——在过去数年取得巨大进步,在模型发布前的审计中扮演日益重要的角色。它可类比为fMRI扫描,帮助我们洞察人工智能“大脑”特定行为的深层原因。例如,我们曾运用可解释性方法(https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents)分析近期对齐事件中未表达的动机。但这些方法并非总能产生清晰可靠的结果。尽管进展显著,我们仍仅理解这些模型内部运作的极小部分。若能以更快速度推进可解释性技术革新,1-2年内有望取得重大突破,而既有的事件记录将提供充足的实验素材。
- **测试与评估**
随着模型能力增强,测试与评估难度同步提升。更智能的模型更擅长欺骗测试,可能在潜藏严重问题的情况下**显现出**对齐状态。建立更广泛、更巧妙的评估体系,辅以可解释性分析进行交叉验证,将具有巨大价值,此领域1-2年内可实现长足进展。
## 嵌入式评估团队
三步计划的首要环节,也是Anthropic即刻单方面承诺的步骤,是引入具备类员工访问权限的嵌入式评估团队,用于验证安全实践并报告事件。
引入嵌入式评估团队看似微不足道,但往往最枯燥或程序化的事项才是最关键。嵌入式评估团队实则是超越当前任何人工智能企业实践的激进举措,其优势在于:
- **可验证性**
嵌入式评估团队可深入细节验证人工智能企业是否真正遵循其声称的训练、部署、运营与防护实践。任何节奏承诺都必然涉及模糊地带、裁量空间与“条文精神之争”,由能接触细节的中立第三方介入至关重要。
- **透明度**
无论作出何种承诺,公众都有权知情。Anthropic长期支持透明度建设:在行业普遍反对监管时,我们已支持透明立法(https://www.nytimes.com/2025/06/05/opinion/anthropic-ceo-regulate-transparency.html);我们的模型卡与风险报告(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)长达数百页。但我们仍是内容取舍的决定者。嵌入式评估团队将改变这种局面。
- **第二意见**
除验证正式承诺与告知公众外,嵌入式评估团队能提供独立于商业利益的第二意见。许多安全效益可能仅源于评估者指出员工未考虑但乐于修正的问题。
正因这些优势,任何节奏提议若从引入嵌入式评估团队开始,成功概率将**大幅提升**。
这些评估者应享有与从事同类风险评估的内部员工相似的持续访问权限与工具。具体而言,Anthropic计划在近期内邀请配备以下条件的外部嵌入式审查团队:
- 驻场办公桌、门禁卡及公司笔记本电脑
- 访问与内部风险评估团队基本相当的工作空间、工具与权限(法律或合同要求、保护客户与合作伙伴隐私信息等特殊情况除外)。我们将建立强化规范,保障审查者接触相关信息的权利,包括与员工实时对话。
- 签订兼顾上述复杂性的合同:外部审查者有权发布关于风险等级、事件、实践及所获权限的关键发现——不受Anthropic编辑控制。我们将保留有限的信息编辑权,用于脱敏安全敏感信息、法律特权信息及个人隐私。
相似文章
掌控前沿节奏
本文探讨了人工智能能力快速加速可能超越社会理解和控制能力所带来的风险,以及需要通过治理工具有意识地掌控前沿整体进展的必要性。
Dario Amodei 要求并提出统一放缓计划
Dario Amodei 要求并提出在前沿AI开发中统一放缓的计划,倡导通过放缓来确保安全。
Anthropic首席执行官概述‘推动前沿’计划
Anthropic首席执行官Dario Amodei概述了应对日益增长的人工智能安全担忧的策略,包括嵌入式第三方评估者和行业协调。
如果AI需要放缓发展,该由谁来做这个决定?
Dario Amodei提议引入外部评审来评估风险,以放缓AI开发进程,此举引发了关于监督与控制的讨论。
Anthropic首席执行官Dario Amodei呼吁放慢人工智能发展步伐
Anthropic首席执行官Dario Amodei敦促放慢人工智能发展以应对安全风险,提议建立独立监督与监管机制,业界人士如Sam Altman和Elon Musk对此作出回应。