制定下一阶段的 AI 构建标准
摘要
OpenAI 概述了其构建标准和推进对齐研究的愿景,以安全地引导 AI 发展,强调自动化 AI 研究和国际合作。
OpenAI 阐述了建立全球共享 AI 标准的路径,呼吁通过协调评估、报告和治理来提升安全性。
查看缓存全文
缓存时间: 2026/09/21 18:52
# 下一阶段AI的建设标准
来源:https://openai.com/index/building-standards-next-phase-ai/
我们的使命是确保通用人工智能造福全人类。正如Sam Altman(https://openai.com/index/built-to-benefit-everyone-our-plan/)和Jakub Pachocki(https://openai.com/index/an-alien-mind/)最近所阐述的,我们围绕这一使命优先开展工作,设定三大主要目标:
1. **引领下一阶段AI发展进程**,通过构建自动化AI研究员,与其协同研究对齐问题,并寻找让人们持续参与自我改进循环的途径。
2. **交付高度智能机器所实现的科学进步与经济增长红利**。
3. **为每个人赋能,提供个人化的通用人工智能(AGI)**。
AI技术正跨越众多公司与国家发展,整个领域的进步改变着每个人面临的机遇与挑战。除了其他益处外,能力强、对齐良好的AI将成为我们顺利度过这一转型期的重要部分——它将强化防御能力、推进对齐研究,并帮助人们理解与引导AI发展的后续阶段。
安全度过这一转型期,需要对齐研究与这些能力发展保持同步(https://openai.com/index/an-alien-mind/),确保我们及他人构建的系统始终与人类价值观保持一致并处于人类控制之下。随着AI系统能力增强、自主性提高(包括承担越来越多的AI研发工作本身),这一点变得愈发重要。要让AI的持续进步既安全又有益,既需要对齐研究的突破,也需要跨实验室、跨国界的共同标准来指导开发。
## 递归自我改进(RSI)
自动化AI研究可以包含不同程度的人类监督。随着AI系统承担更多开发下一代AI的工作,它们将越来越能驱动递归自我改进(RSI)的进程,即使人类仍参与其中。随着这一过程自动化程度提高,AI进步的速度可能迅速加快。
我们相信,自动化AI研究将产出直接改善人们生活的模型。它能降低高级智能的成本,使全球人民受益。自动化研究还能帮助我们大幅改进对齐技术,并针对日益强大的AI构建防御体系——自动化AI研究员同样可以成为自动化AI*安全*研究员。能力更强、对齐更好的系统可以帮助保护关键基础设施、防御危险AI智能体,并开发新的防护措施。
完全自主的RSI目前尚未实现,我们不应在能够安全实施之前追求它。是否推进及如何推进,必须取决于我们保持人类控制的能力,并基于关于其益处与风险的知情民主选择(链接到新窗口)(https://cdn.openai.com/pdf/25752ecb-0e5c-47f9-b9e4-c0f4d76f8d3d/a-blueprint-for-a-federal-framework.pdf)。若在缺乏适当谨慎的情况下推进,RSI可能导致人类对AI发展失去实际控制,无法对已无法理解的研究过程进行监督。由此,AI可能变得更危险、更不对齐,总体上对人类构成威胁。我们披露的Hugging Face事件(https://openai.com/index/hugging-face-incident-and-the-road-ahead/),虽非RSI的直接结果,却预示了在缺乏健全安全保障和对齐措施的情况下,风险可能急剧恶化的景象。
## 国际标准
前沿AI开发中安全与保障实践的国际标准,其重要性可能不亚于对齐研究本身。标准能为高质量证据创建共同定义,并就技术保障措施的严谨性达成一致基准。简言之,它们帮助我们回答:“在缓解灾难性AI风险方面,什么是好的实践?”
现有的民主机构,如AI标准与创新中心(CAISI)、各州法律以及联邦AI框架,都能为此提供帮助,公私合作的新形式(链接到新窗口)(https://demishassabis.substack.com/p/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age)亦是如此。但AI的开发与部署正发生在多个国家,其采用是全球性的,其影响很可能以各种方式、在各种时间线上影响到每个人。
因此,需要国际层面的标准制定工作来解决一些关键挑战:
- **碎片化**——不同国家的评估、报告要求和事件定义可能相互冲突,使得证据比较、理解新兴能力以及应对跨国风险变得更加困难。
- **集体行动**——各国各自为政可能产生任何国家都不希望的结果。RSI有能力加速AI研究本身,其进展可能超出我们集体理解、评估风险并维持有效人类监督的能力范围。
- **能力不均**——前沿AI开发及相关专业知识在全球分布不均。这加剧了上述两个问题。
这些挑战适用于开放模型和封闭模型。
需要明确的是,任何从事自动化AI研究或其他先进能力开发的AI实验室,都必须根据基本责任原则和现行法律,对其安全负责。我们主张制定标准的理由根植于避免权力集中并产生更佳实际成果。标准为实验室外部的更多利益相关方提供了一种方式,让他们能对技术应如何发展发表意见,并提供一套可见的原则,无论任何特定实验室的具体实践如何,这些原则都可被依赖。而且,如果各方能协作应对上述挑战,我们很可能会获得更好的结果。
**这就是为什么我们相信,美国应引领一项工作,与世界各国共同制定前沿AI的全球技术标准,包括针对RSI的标准。**
虽然我们预期这一概念会随时间大幅演变,但两个方面至关重要。
## (1)促进国家与国际前沿标准互补的机制
实现这一点的一种方式是利用正在兴起的AI安全机构网络——例如已在澳大利亚、加拿大、德国、法国、肯尼亚、日本、韩国、新加坡、印度和英国建立的机构——通过CAISI和各国行业机构促进标准制定,并特别关注:(1)按能力基准衡量的前沿AI模型与开发者;(2)自动化AI研究(包括RSI)的利弊风险管理。美国可以在CAISI于2024年创建的国际先进AI测量、评估与科学网络(链接到新窗口)(https://www.nist.gov/news-events/news/2026/02/international-network-advanced-ai-measurement-evaluation-and-science)基础上进一步推进,该网络汇集了公共机构以在AI测量、评估与科学方面开展合作。
此项工作制定的标准将为能力测量与评估、风险评估和保障充分性提供共同的技术基础。这些技术标准并非许可、强制性发布前审查或AI模型的批准要求。各国政府将决定是否以及如何将这些标准纳入其本国法律体系。
此项工作还应通过咨询开放模型与封闭模型开发者、独立技术专家和学术界,支持具有竞争力的AI生态系统。共同标准应以透明方式制定,并设计为不对特定公司、国家或商业模式(包括使新进入者或开放权重开发者更难竞争)产生优势作用。
正如我们曾建议(链接到新窗口)(https://www.ft.com/content/0c2e1077-f658-4b3d-9040-602615c961ca)的,这种方法可以借鉴航空和金融稳定等领域的经验,在这些领域,各国在没有放弃国家主权的情况下,制定了共同的技术标准和可信的合作渠道。它还应与既有的及新兴的标准制定机构密切合作,例如ISO(链接到新窗口)(https://www.iso.org/committee/6794475.html)、前沿模型论坛(链接到新窗口)(https://www.frontiermodelforum.org/)、Agentic AI基金会(链接到新窗口)(https://aaif.io/)和开放安全AI联盟(链接到新窗口)(https://blogs.nvidia.com/blog/open-secure-ai-alliance/),以及专注于实施的组织,如正在制定连接国际标准与现实世界AI评估的实用规范的Appia基金会(https://openai.com/index/helping-build-shared-standards-for-advanced-ai/)。
## (2)用于更好集体行动的共同测量和事件报告协议
国际AI标准在管理AI研究中日益增长的自主性及递归自我改进方面将尤为关键。具体而言,这些标准可包括:
- 评估与RSI相关的AI进展及AI公司内部进行的自主研究量。我们近期关于研究加速(https://openai.com/index/research-acceleration-view-inside-openai/)的报告是对此项工作的初步贡献。
- 人类对自动化AI研究的监督,包括哪些类型的自动化AI研究流程应触发即时的人工审查。
- 针对对齐和自动化AI研究问题的事件分类、跟踪、报告与响应,例如通用的事件严重等级和报告门槛。我们的不对齐报告框架(https://openai.com/index/model-misalignment-reporting-framework/)是早期的贡献。
除了这些标准,我们相信,全球关键基础设施运营商和政府建立安全的沟通渠道,以在快速发展的前沿AI安全领域共享国家安全关切、新兴漏洞与威胁以及最佳实践,这一点至关重要。美国与在这些领域的对话将是一个积极步骤,即将进行的会谈恰逢其时。
## 美国应引领
掌控AI发展速度并非维持预设的技术节奏。技术上,它关乎确保对齐研究及其部署始终领先于能力发展。社会层面上,它关乎利用标准、制度和协作,来放大产业网络、社会关系与市场力量,以产生正和结果。最近关于网络防御(https://openai.com/collective-cyberdefense/)的集体行动呼吁便是后者的例证。
美国具备引领的良好条件,因为其AI产业处于技术前沿,并且在金融、贸易、国防、技术和信息系统等关键领域,仍保持着特权的全球网络地位。现在引领将决定美国是塑造全球AI框架,还是看着一个碎片化、不均衡且充满冲突的体系在周围形成。这也将决定先进AI是加强美国及其盟友已有的网络;未能引领则可能削弱它们。
地缘政治竞争不仅关乎技术领先,也关乎AI的采用与普及。后者将越来越取决于谁在推动切实的合作和明智的规则,让各处的企业和社会在押注未来于这项技术时都愿意接受。
通过切实的国际合作连接起来的强大国内治理,为加强安全保障、持续创新和广泛共享AI益处提供了一条路径。
相似文章
助力构建先进AI共享标准
OpenAI参与创立了由Linux基金会托管的Appia Foundation,旨在开发用于评估先进AI系统的开放、模块化标准,从而在整个AI价值链中创建一种关于信任与安全的共享技术语言。
为 AGI 及其未来做好准备
OpenAI 阐述了为 AGI 做准备的战略,强调通过真实世界反馈循环进行渐进式部署,随着系统接近 AGI 能力而提高谨慎程度,以及开发更好的对齐技术以确保 AI 系统保持可控和安全。
为什么负责任的AI开发需要在安全问题上进行合作
OpenAI发布了一份政策研究论文,确定了四项战略来改进行业在AI安全规范方面的合作:传达风险/收益、技术协作、提高透明度和激励标准。该分析论述了竞争压力如何可能导致对安全性的投资不足,并提出了协调激励措施以促进安全AI开发的机制。
呼吁所有人工智能公司公开所有安全与对齐研究
Dario Amodei 强调人工智能对齐问题是对人类的威胁,并敦促人工智能公司公开合作安全研究,而不是将其视为竞争优势。
OpenAI 安全实践
OpenAI 介绍了其积极采用并不断改进的 10 项安全实践,包括实证红队测试、对齐研究、滥用监控以及在首尔 AI 峰会上分享的自愿承诺。该公司强调采用均衡、科学的安全方法,将其融入开发的各个环节。