迈向前沿AI训练的安全案例
摘要
OpenAI概述了前沿AI训练的安全案例,提出技术保障措施,包括对齐、遏制和监控,以确保安全发展。
我们早期的前沿AI训练安全案例指南涵盖技术保障措施、操作实践和调查对齐问题事件。
查看缓存全文
缓存时间: 2026/09/29 07:58
# 为前沿AI训练建立安全案例
来源:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/
我们相信,我们正进入一个新纪元(https://openai.com/index/an-alien-mind/),在这个时代,继续进行任何前沿强化学习训练之前,都应要求提供结构化的安全文档。理想情况下,这种文档应达到“安全案例”的水平——即其他安全关键行业中使用的、全面、结构化、基于证据的风险论证。我们将安全案例视为我们正在努力实现的理想目标,同时承认,由于AI能力每一新层次涌现出的复杂性,使其像航空或核能行业那样严格并非易事。我们正在制定一个框架来规范这些实践。
以下是我们认为应纳入此类前沿AI训练安全案例的一些初步指南。这些最佳实践反映了我们当前的经验总结,并且我们预计,随着我们继续迭代内部谨慎开发流程,它们将会演进。我们现在分享这些内容,是为了使我们的当前思路透明化,并邀请社区提供反馈。请注意,本文档侧重于前沿强化学习训练;内部和外部部署需要考虑更广泛的对齐属性。
## 1. 技术保障措施
安全案例应涵盖技术栈的三个层面:对齐训练、遏制和监控。这些保障措施有助于确保模型不会尝试采取未对齐的行动,并且即使它这样做了,也难以突破遏制措施,同时监控系统能在造成伤害之前发现问题。
- **模型对齐**:第一道防线应是训练对齐的模型;即,使其以可靠的方式按我们意图行事。这可能包括:
- **训练环境与评分:** 通过防止在训练过程中对奖励黑客行为给予正向强化,来降低模型发展未对齐行为的风险。这可以包括:
- **自动化数据集审查:** 使用代理来发现和修复可能允许未对齐轨迹通过漏洞(而非预期行为)获得高奖励的损坏强化学习环境,从而减少训练期间强化未对齐行为的机会。
- **人工数据集审查:** 作为自动化红队测试的补充,对数据集进行人工审查和质量检查,以识别可能无意中强化未对齐行为的缺陷任务。
- **评分器调优:** 调优评分器以惩罚模型在训练期间尝试利用或破坏强化学习环境的行为。
- **先前运行分析:** 对先前实验的跟踪运行分类器,以确保评分器按预期工作。
- **对齐测量:** 运行评估以跟踪模型的未对齐倾向,从而衡量对齐训练的效果。这可能包括:
- **离线对齐评估:** 在前沿运行期间进行对齐评估,以评估训练是否按预期进行,并调查任何重大退步。
- **回测:** 在先前的事件上回测对齐评估,以确认评估能检测到以前未对齐的模型,并且没有过拟合到特定事件上。
- **追踪评估博弈:** 追踪评估意识或元博弈(模型意识到自己正在被测试)可能引发的行为变化(例如,在对齐评估上启用评估意识和元博弈监控器),并设定具体的阻断阈值。
- **最坏情况压力测试:** 引出最坏情况的不当行为,并检查至少有一个评估能检测到这种行为。
- **防止在思维链上训练:** 不让自动化评分器看到强化学习中的思维链,以防止模型演进以规避思维链监控。
- **遏制:** 在模型变得未对齐的情况下,使沙箱和安全性足够强大,以防止有害行为发生。这可能包括:
- **多层基础设施安全:** 大力加强模型运行的沙箱和托管沙箱的研究基础设施,以确保在沙箱逃逸事件中有额外的保护层。
- **遏制红队测试:** 使用前沿训练运行中的检查点,迭代地对这些系统进行红队测试(须进行安全分析),以改进沙箱、研究基础设施和周边安全,发现并关闭任何缺口。同时对模型在训练期间可能接触的所有服务(例如互联网缓存)进行红队测试。
- **跨样本通信:** 将高带宽跨样本通信限制在经批准的途径,例如多代理工具,并关闭高带宽且易于被代理发现的基础设施旁路通道。
- **不可变记录:** 在所有强化学习训练、评估和内部部署期间,将代理记录以不可变方式保存一段合理的时间(例如,在一次写入存储账户中),以实现可靠的事件调查并防止无意编辑。
- **监控:** 在模型开始采取未对齐行动的情况下,拥有一个实时监控系统来捕捉任何潜在的未对齐问题,并在严重事件发生前快速处理优先问题。这可能包括:
- **强制可监控性:** 确保模型保持可监控性,通过可监控性与规避监控评估来衡量,并有明确阈值,以尽早发现令人担忧的行为。
- **对已知问题的高召回率:** 确保监控系统在保留评估集上对历史事件具有高召回率。
- **监控器评估的新鲜度:** 为新的运行创建代表全新风险的评估数据点,以避免监控器的召回率和精确度指标变得过时。
- **快速响应:** 实施优先级警报,使其在模型造成伤害之前(例如,在白天对事件呼叫安全值班和运行负责人,在夜间对未确认的警报自动暂停运行)按照定义的服务级别协议(SLA)采取行动,要么呼叫值班人员,要么自动暂停受影响的运行。
## 2. 操作指南
除了关于技术保障措施的建议外,我们还在为前沿AI训练运行的安全案例制定操作最佳实践。这些可能包括:
- **异议(事前验尸):** 在起草安全案例后,应由另一个团队的成员撰写异议,以发现安全案例中的潜在漏洞,并分享经过校准的风险评估,然后训练团队应对此进行处理,以帮助加强安全案例。
- **批准:** 安全案例应由高级管理层成员审查,他们每个人都应有权否决该运行,以确保存在多个内部检查(例如,研究组织负责人/副总裁、安全主管和首席科学家)。
- **问责:** 负责训练运行的高级领导(例如,研究组织负责人/研究副总裁)应对安全案例和任何事件响应负责(包括作为绩效评估的一部分),以便训练团队也有动力推动安全和对齐。
- **暂停:** 如果发现会使安全案例无效的问题(例如,新的安全问题),应确保有运行手册、技术控制和服务级别协议来暂停所有涵盖的运行。
- **内部透明:** 安全案例应提供给内部监督小组(例如,安全与安保委员会)。
- **审计:** 应为审计员提供足够的访问权限,以验证安全案例的主张是否有效可靠,并在发现差距时提出。
- **上报:** 应有明确的流程上报未对齐升级情况,包含定义好的未对齐严重级别表格,以及一个未对齐值班人员,当运行达到某个严重级别时可以呼叫高管(例如,首席执行官)。
- **技术控制:** 人类和代理应难以启动不合规的运行。监控和自动暂停等安全功能应采用故障关闭模式(例如,不可能在没有启用适当监控的情况下启动运行,或在强化学习训练、评估或内部部署中禁用监控器)。
- **回滚能力:** 应易于识别训练过程中未对齐模型的所有下游用途(例如,数据生成或评分),以便在必要时能够撤销未对齐输出的影响。
- **剩余风险完整性:** 安全案例应尽可能全面列举当前已实施缓解措施未涵盖的剩余风险,以便做出知情的风险接受决策。
这些建议代表了我们当前的推荐,目前正在OpenAI内部实施。我们预计我们的实践将在未来几周内持续演进。
## 3. 未对齐事件的调查
我们也在制定一些调查严重AI未对齐事件的最佳实践。实验室应力求从单个事件中尽可能多地学习(类似于其他高风险行业的调查实践(https://www.ntsb.gov/Advocacy/Activities/Pages/homendy-20210930.aspx)),以便能够防止此类事件在未来发生。此类行动的一些示例可能包括:
- **内部透明:** 由于调查可能需要相当长的时间才能完成,事件调查应定期向内部报告进展(例如,对正在进行的调查进行每日更新)。如果安全且与其工作相关,员工应有明确的途径获取更多访问权限,包括原始记录和从未对齐模型中采样。
- **未对齐根本原因:** 研究人员应对训练动态进行根本原因分析(例如,通过针对性消融实验或重采样实验),以理解未对齐行为是如何引入的,从而更好地理解未对齐的科学,并更好地在未来预防它。
- **事后剖析:** 应进行操作和文化上的事后剖析,以了解导致事件的所有促成原因,例如为什么问题被引入并在事件前未被发现或未上报。
- **检测:** 我们应开发能够发现导致事件倾向的对齐测试方法,而不是直接利用从事件中得出的信息(例如,记录或事件摘要)进行爬坡式优化。应从事件中创建评估作为“回归测试”,以确保未来的模型不会在非常相似的事件中表现出未对齐倾向。
- **公开披露:** 调查结果、事后剖析和操作变更应在调查结束后与公众分享(https://openai.com/index/model-misalignment-reporting-framework/)。应尽快通知受影响的第三方。
相似文章
@OpenAI:我们如何思考保障前沿强化学习训练运行的安全:
OpenAI 阐述了保障前沿强化学习训练运行安全的最佳实践,倡导结构化安全案例以确保模型对齐和遏制。
前沿AI监管:管理新兴的公共安全风险
OpenAI提议了一个针对可能造成公共安全风险的「前沿AI」模型的监管框架,倡导制定标准流程、注册/报告要求和合规机制,包括部署前风险评估和部署后监测。
OpenAI 的前沿风险应对方案
OpenAI 公布了其应对前沿 AI 风险的方案细节,并宣布了在 2023 年 7 月自愿承诺的安全措施取得的进展,包括发布 DALL-E 3 系统卡和开发新的准备框架以管理先进 AI 系统可能带来的灾难性风险。
加强我们的前沿安全框架
DeepMind 发布了第三版前沿安全框架,扩展了风险范围以包括有害操纵和不对齐风险,并完善了风险评估流程和高级 AI 模型的治理协议。
OpenAI 安全实践
OpenAI 介绍了其积极采用并不断改进的 10 项安全实践,包括实证红队测试、对齐研究、滥用监控以及在首尔 AI 峰会上分享的自愿承诺。该公司强调采用均衡、科学的安全方法,将其融入开发的各个环节。