@OpenAI: 作为我们保持技术前沿努力的一部分,我们致力于支持具有深入程度的独立评估……
摘要
OpenAI概述了四个优先领域和原则,以支持独立的第三方AI安全评估,强调前沿AI发展中的严格性、安全性和问责制。
查看缓存全文
缓存时间: 2026/09/22 17:47
作为我们推动前沿发展努力的一部分,我们致力于为独立评估提供在训练、评估和部署各环节的深度访问权限。
这种访问权限将使第三方评估者能够质疑我们的假设、识别我们可能忽略的风险,并对我们的安全防护措施有效性形成独立判断。
以下是我们为深化评估制定的四个重点领域,以及确保评估严谨性、安全性和独立性的原则:
有效第三方评估的重点领域与原则
来源:https://openai.com/index/priorities-principles-third-party-assessments/ 前沿人工智能实验室在模型安全训练、评估和部署方面承担着巨大责任。第三方评估是平衡这一责任、扩大AI安全参与机会、保持公众知情度以及确保实验室对明确且经独立验证的安全声明保持问责的关键环节。
作为我们推动前沿发展(https://openai.com/index/an-alien-mind/)努力的一部分,OpenAI致力于为独立评估提供在训练、评估和部署各环节的深度访问权限。这种访问权限应使评估者能够质疑我们的假设、识别我们可能忽略的风险,并对我们的安全防护措施有效性形成独立判断。
长期以来,我们一直在模型开发和部署流程的各个阶段与第三方评估者(https://openai.com/index/strengthening-safety-with-external-testing/)合作。我们还将第三方评估纳入我们的预备框架(https://openai.com/index/updating-our-preparedness-framework/)实践,并支持那些倡导更严格、更可问责流程的组织和立法(https://openai.com/index/frontier-safety-blueprint/)。在这些合作中,我们提供了多种形式的深度访问权限,包括我们的技术防护信息、可见的思维链访问权限,以及前所未有的机密数据和内部部署访问权限,用于事件响应和监控红队测试。此处分享的重点领域和原则聚焦于我们与私营和非营利部门独立评估组织在技术安全评估方面的合作。这些内容与我们和政府在测试评估方面的合作相辅相成——不同的角色和职责可能需要采取不同的方法。
使这些评估有效需要强大的独立机制、科学严谨性、稳健的安全实践和明确的职责分工。实验室有责任在保护敏感信息的同时进行有意义的审查。实验室和独立评估者共同承担确保评估成功的责任,并应遵循(https://openai.com/index/building-standards-next-phase-ai/)国际公认的安全实践共享标准。下文我们提出了四个深化评估的重点领域,以及确保评估严谨性、安全性和独立性的原则。
评估重点领域
当第三方评估针对具体、关键的问题时最具价值:证据是否支持实验室的安全论证和安全声明?评估是否充分测试了其旨在衡量的风险?安全防护措施在现实条件下是否有效?
此处描述的评估将根据所考察的安全问题采取不同形式。我们预期将支持多项评估同时进行且持续不同时间周期,有些持续数周,有些则持续数月。虽然第三方评估也可作为部署前工作的一部分并可能影响部署决策,但此处描述的工作通常是长期且不针对特定发布日期的——专注于随时间深入检验特定的安全声明。
在我们的重点领域和原则中,我们提及了安全声明和安全论证。这些术语的含义如下:
我们提出四个深化评估的重点领域,以及确保评估严谨性、安全性和独立性的原则。
- 安全论证的独立评估,涵盖训练、评估、内部部署和外部部署。 安全论证的评估需要对齐、控制方法(如监控)、网络安全、生物和化学误用以及红队测试等领域的专业知识。安全论证包含训练、能力评估和防护措施等方面的声明,这些可以整体或部分评估(见下文重点2和3)。可能需要多位评估者根据各自专长检查论证的不同部分。他们的评估应共同回答以下问题:
- 支持训练、评估和部署安全论证的证据是否得到证实?安全论证的条件在训练、评估和部署过程中是否得到遵守?
- 我们的安全论证是否涵盖了评估过程中识别出的最紧迫风险?安全声明是否支持整体安全论证?是否存在差距或改进领域?
- 是否使用了有效方法来识别和减少训练中可能奖励欺骗、奖励黑客攻击、破坏性行为或规避限制的动机?
- 关键防护措施的评估,涵盖内部和外部部署 我们的防护体系始终在发展以适应不断变化的能力和格局。我们的防护措施涵盖训练、内部部署和外部部署。目前包括模型级防护、执行防护和安全防护,以及失协调监控——涵盖广泛风险(如控制丧失以及网络、生物和化学风险中的误用)。技术合作可以在改进评估方法和加速标准制定的同时,识别当前防护措施的弱点,为未来推动前沿发展的公共政策提供更坚实的技术基础——特别是对于安全和安全标准仍处于起步阶段的内部部署。独立评估应检查这些防护措施的效果及其可能存在的不足,例如:
- 使用“灰盒”访问权限,防护措施是否能抵御对抗性测试(越狱),并在高风险领域(如网络、生物)充分防止能力提升?我们的对抗性测试和红队测试是否覆盖了最重要的风险?
- 在模拟真实运营条件的授权测试中,智能体如何与访问控制、沙箱、检测和响应系统等网络防御机制交互?哪些防御机制能预防、检测或遏制有害行为?它们在哪里会失效?
- 对于内部和外部部署,我们的失协调监控是否存在可能导致控制丧失或严重失协调的关键缺陷?随着模型能力提升,思维链监控作为安全或对齐证据来源的可靠性如何?
- 是否在所有相关的训练、评估和部署中实施了适当的监控,且该监控不易被禁用?
- 防护措施的实施是否与模型能力相称?
- 涵盖预备框架风险类别(化学和生物风险、网络安全、AI自我改进)的能力评估以及针对失协调风险的对齐评估 我们的预备框架要求评估关键前沿风险领域。当评估阈值被超越和评估出现饱和时,持续更新并确保评估的覆盖面和质量至关重要,这些评估既要评估预备框架风险领域的能力,也要评估旨在评估严重失协调风险的对齐评估。相关问题包括:
- 评估预备框架风险的评估是否充分覆盖了预备框架风险阈值定义?这些评估的阈值设定是否正确?
- 当模型持续获得最高分数时,评估是否得到更新?新的测试是否能有意义地衡量更先进的能力?
- 我们的对齐评估是否充分覆盖了严重的失协调风险?它们可能遗漏哪些重要的行为或条件?
- 关键失协调事件的独立调查 独立调查对于一系列关键AI安全事件都很有价值。在此,我们聚焦于模型失协调,包括未经授权行动或规避监督的模型,这甚至可以在没有恶意使用的情况下揭示对齐方法和防护措施的弱点。在特定情况下,如OpenAI Hugging Face事件,引入独立第三方进行独立的失协调事件调查(https://openai.com/index/model-misalignment-reporting-framework/)可能是有益的。参与事件调查的第三方必须具备必要的调查专业知识,包括视情况而定:网络取证专业知识、对齐专业知识、大规模思维链分析,以及及时开展调查所需的人员和资源。事件响应可能涉及访问敏感的内部数据和第三方数据,因此某些细节可能因敏感性而不宜公开或访问。独立调查的发现也可通过提供证据来评估关于其对齐状态以及为补救先前观察到的失协调所采取措施有效性的声明,从而为模型的安全论证提供信息。在失协调事件的背景下,我们优先进行以下方面的独立评估:
- 事件过程中发生了哪些模型行为或失协调问题?主要促成因素是什么?
- 防护措施和补救措施能否在未来有效缓解类似事件?
有效评估的原则
- 明确界定并经双方同意的评估声明: 评估应从双方同意的范围开始,随后在评估活动开始前预先注册明确定义的安全声明。第三方和实验室应澄清:是被评估公司希望提出供评估的声明,还是第三方评估者旨在独立评估且实验室同意接受评估的声明。某些声明可能超出范围有许多原因,包括第三方无法访问数据、评估者专业知识不足,或紧急评估的合理时间限制。实验室和评估者应建立流程来考虑在原始范围外发现的重大风险,包括是否需要进行进一步调查。结论应明确说明哪些内容被评估了,哪些没有,以及与双方商定范围的关系。
- 适度访问: 评估者应在法律、安全和知识产权限制范围内,获得与其评估的经同意声明相称的访问权限。如果直接访问不切实际或无法实现,评估者可与公司的指定代表合作,或探索间接或隐私保护访问机制以保护基础信息。
- 透明的方法和标准: 评估者应解释其方法、评估标准和不确定性,并尽可能参考现有标准。在标准尚不存在的情况下,应清晰说明其所用标准的合理性。报告应区分直接发现和解释,说明不确定性,并明确证据支持哪些结论。
- 专业知识和独立性: 评估者应展示相关的技术专长,并识别、披露和处理组织和个人的利益冲突,包括财务激励、与开发者的关系,以及先前参与被评估工作的情况。应设计保障措施以确保商业压力和薪酬安排不会影响发现,可包括回避或适当的排除期。
- 安全与保密: 评估者应展示与其所访问系统和信息的敏感性相称的信息安全实践和可执行的保密保护措施,覆盖其人员。这些保护应涵盖知识产权、敏感信息和评估记录。如果评估者在其自身环境中无法满足安全要求,或所访问数据特别敏感,则使用公司管理的设备或场所进行访问可能是合适的。
- 可操作的发现与补救时间: 评估应识别具体差距并提供足够详细的信息以便实验室解决。在适当时,实验室应在发布前有合理的时间来补救问题。在相关情况下,报告还应解释对智能体开发者、部署者和防御者的经验教训,并提供可实施的实用建议。
- 负责任的发布实践: 评估报告应基于证据,并在保护敏感和机密信息的前提下尽可能公开共享。如果完全公开披露不可行,向适当的监督机构(如公司治理机构或董事会)进行保密报告可支持问责。应实施有原则的编辑保护政策,并对反馈和纠正不准确信息有明确预期,以维护独立性和保密性之间的平衡。评估者应保持编辑独立性,同时确保保密和知识产权保护得到维护。评估者应采用明确的编辑政策,允许实验室请求编辑敏感信息,同时评估者可注明已进行实质性编辑及其对评估报告的影响。
未来之路
我们致力于支持独立评估者,并通过未来的法律和私人治理机构,建立更清晰、共享的国际标准,以实现有效的第三方评估。虽然独立评估生态系统仍在成长中,我们将通过支持并与在前沿安全问题上拥有深厚专业知识的多元独立评估者群体合作来助其成长。没有任何一个第三方能够或应该全面覆盖紧迫的前沿安全问题。我们将审慎且有目的地提升自身能力,并使成长的第三方生态系统能在最佳实践和原则上保持一致。我们正在与多个第三方就符合上述重点领域提议进行沟通。
相似文章
有效第三方评估的优先事项与原则
OpenAI 概述了提升 AI 安全性的有效第三方评估的优先事项与原则,强调独立审查、共同标准和深入访问以进行严格评估。
通过外部测试强化我们的安全生态系统
OpenAI宣布通过外部第三方测试和评估前沿AI模型来加强安全生态系统,包括独立评估、方法论审查和领域专家探测。该公司承诺通过公开分享第三方评估结果和自GPT-4推出以来支持独立评估来提高透明度。
@Miles_Brundage: 我离开OpenAI后决定全力投入前沿AI审计的原因之一是,如果AI公司需要…
Miles Brundage讨论了他在离开OpenAI后转而专注于前沿AI审计的决定,强调独立审计员可以安抚AI公司,让他们相信同行也在采取成本高昂的安全措施。AVERI支持这一观点,倡导在独立监督下进行有节奏的发展。
@OpenAI:我们使命的核心是研究如何确保日益强大的人工智能惠及每一个人。我们相信……
OpenAI 讨论随着前沿模型开发的加速,世界需要调整人工智能发展的步伐,并表达了希望与美国政府领导的项目以及其他实验室和开源社区合作,共同做出贡献的意愿。
@sama: 我同意 Dario,我们需要放慢前沿技术的步伐。这一直是我们在 OpenAI 近期讨论的主要话题……
Sam Altman 同意 Dario Amodei 关于放慢 AI 前沿发展的呼吁,并承诺 OpenAI 将使用具有员工级访问权限的独立评估者。