网络安全关键能力时代下的模型开发节奏控制

OpenAI Blog 新闻

摘要

OpenAI讨论暂停模型开发以加强安全保障措施,以应对网络安全风险和对齐挑战,并强调事件及即将推出的模型如Astra。

OpenAI正在加强前沿AI模型的监控、对齐和安全性。了解新安全措施如何指导模型开发的进度。
查看原文
查看缓存全文

缓存时间: 2026/08/18 19:05

# 在关键网络能力时代管控模型开发进度 来源:https://openai.com/index/pacing-model-development-cyber-capabilities/ 过去数周,两个重要事件进一步揭示了日益强大的AI系统所带来的风险增长:OpenAI与Hugging Face的安全事件(https://openai.com/index/hugging-face-model-evaluation-security-incident/),以及关于我们即将发布的模型Astra可能达到《准备框架》(https://openai.com/index/updating-our-preparedness-framework/)中定义的关键网络安全能力阈值(https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/)的初步证据。这些发展结合我们内部研究的快速进展,为我们在整个训练流程中强化监控、对齐和安全防护措施的工作增添了紧迫性。 随着模型能力增强,内部开发与测试过程中的风险也在增加。我们的监控、对齐和安全标准必须领先于这些风险。为确保达到相关标准,我们暂时放缓了扩展速度:在最新待部署模型的强化学习(RL)训练中暂停两周,以进一步加固研究环境并开展红队测试,同时扩大监控系统覆盖范围。目前我们仍在暂停最大规模的前沿RL训练计划,转而通过小规模训练和评估来研究模型行为、验证安全措施,并在推进前积累更多对齐证据。 对齐研究(https://openai.com/safety/how-we-think-about-safety-alignment/)——确保AI系统按预期行为并接受人类监督的工作——一直是研究计划的核心。基于现有研究和评估,我们现在要求在整个训练过程中提供更有力的对齐行为证据。保持日益强大的系统与人类意图一致是整个领域需要应对的挑战。即将推出模型的进展信号清楚地表明,我们需要更全面的应对方案——在现有准备框架基础上进行扩展和深化。 我们认为必须透明地展示我们方法的变化。以下将介绍已实施的研究流程与基础设施改进,以及仍在进行中的工作。 ## 强化更强模型的安全防护 我们开发更强模型的方法建立在三个相辅相成的保障措施之上: 1. **监控机制**:检测并响应异常行为 2. **对齐研究**:降低有害或越权行为的可能性 3. **安全措施**:限制AI系统的访问与影响范围 我们预计模型很快将主导大部分安全工作,包括抵御其他模型的攻击。这将使三大保障措施能随模型能力同步扩展——我们认为这至关重要。 我们将这些措施应用于研究与部署全流程,并针对每个模型的能力、运行环境和风险等级进行适配。 ### 加固研究环境安全 随着前沿模型获得更强的网络安全能力,我们正在提高训练与评估环境的安全标准。满足这些标准需要大量工程投入,也造成了前沿研究的成本增加与进度延迟。在OpenAI-Hugging Face事件*发生后,我们立即暂停了研究集群中可能执行代码或使用可联网工具的前沿模型推理服务。我们快速恢复了更受限的安全代码执行路径,随后逐一评估各工作负载能否安全恢复运行。部分研究工作在新管控下恢复,其余则需要进一步调整。 过去数周内,我们已制定并开始实施针对前沿研究工作负载的更严格安全要求,例如: - **工作负载隔离**:对执行模型生成代码或不可信代码的工作负载实施更强隔离(“沙箱”),同样适用于处理模型输出时可能被入侵的软件。 - **网络隔离**:实施更多管控措施,将高风险及不可信工作负载与互联网隔离。这些设计确保单一工作负载或支撑服务被入侵时,不会直接导致互联网或内部网络被越权访问。 - **持续安全测试**:重构环境以移除潜在脆弱的共享服务,缩减常驻权限,完善安全与信任边界。同时增强安全日志的收集与监控能力。我们还投入资源使用自有模型实现自动化,通过模拟攻击持续测试这些边界。 这些控制措施共同构建纵深防御体系,保护我们的研究环境免受攻击。目前对涉及Astra或网络模型的工作负载实施最高等级安全防护,因为经评估Astra模型可能具备关键级网络能力。该防护等级同样适用于所有其他网络相关工作负载。 虽然部分Astra训练与评估已满足新标准,但大量工作负载仍处于暂停状态,直至完成迁移升级以满足新安全要求。我们优先推进安全与对齐相关工作负载的迁移工作。 ### 扩展思维链监控 监控一直是模型开发流程的重要环节,包括对内部编程代理(https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/)和长周期运行任务(https://openai.com/index/safety-alignment-long-horizon-models/)的监控。我们此前特别关注前沿模型的内部部署和前沿RL训练运行,因这些被视为最高风险工作负载——它们结合了先进模型能力与工具访问、敏感系统、内外网络连接权限。原有监控并未覆盖所有使用工具的推理与训练运行。通过新监控体系,我们已修订并扩展了相关方案。 新监控体系采用多阶段架构:激活分类器(检查模型内部活动的检测器)在每个采样词元上运行,并将潜在问题逐级上报给越来越复杂、算力需求更高的自动化调查系统。这些系统会审查工具操作、可获取的推理内容及完整活动序列,检测未授权访问、数据窃取、破坏性行为及试图突破安全防线的操作。我们的目标是在监控系统发现异常活动后30分钟内发出警报。若系统识别出可能突破关键安全边界的情况,将生成最高优先级警报。在当前实施方案中,安全、安保与研究团队会收到紧急通知。若30分钟内无法明确判定为误报,相关团队需暂停该活动。 对于所有使用工具的Sol能力等级及以上模型的RL训练与评估,此监控为强制要求。自8月7日确定Astra可能具备关键网络能力后,我们对所有使用工具的Astra推理任务(不仅限于RL训练与评估)新增了额外监控要求。 这些安全措施需要显著的算力投入。当前估算显示监控开销约占被监控推理算力的20%,但成本在不同训练和评估任务间存在显著差异。我们将在后续博文中分享该系统的更多细节。 ### 深化对齐研究 对齐研究是实现我们使命的核心——确保通用人工智能惠及全人类。随着模型获得网络攻击等先进能力并在更复杂环境中运行,奖励欺骗(在训练中获取高奖励却未真正达成目标)、欺诈或未授权访问等未对齐行为将带来日益严峻的风险。 针对最强大模型的RL训练,我们正将核心技术应用于更多训练阶段。这包括:改进奖励模型以更有效地检测并抑制跨任务、跨环境的不安全行为;训练模型更真实地表述其行为、能力与局限;减少利用奖励机制、评分系统、工具或监督流程漏洞的行为。同时增加针对模型与外部系统/资源交互时可能造成危害的行为的训练覆盖。 我们将持续投入对齐研究,扩展评估范围,并利用研究成果指导训练与安全措施。计划在近期公开更多对齐研究详情,包括模型行为研究发现与发现的新挑战。 ## 后续计划 我们将演进准备框架,在训练与部署全过程中整合这些安全措施,更好地反映未来模型的能力及其运行环境。开发能随能力扩展的方法,需要在模型辅助安全、高效监控及对齐研究领域持续投入。我们打算在发展过程中引入外部组织参与,并分享更多研究成果。 前沿模型的能力正在快速加速演进。我们理解、对齐和保障这些系统的能力必须始终保持领先。 *\*我们将在未来数周内发布技术报告详述相关经验。*

相似文章

OpenAI表示因安全担忧放缓了Astra模型的开发

TechCrunch AI

OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。

OpenAI 暂停新模型开发,据称因其过于强大

The Verge

OpenAI 正在暂停其正在开发的 Astra 模型的相关内部活动,原因是担心该模型在《预备框架》下可能达到关键的网络安全能力。此前,Anthropic 和 Meta 近期也发生了 AI 模型失控的事件。

应对关键网络能力的下一个前沿

OpenAI Blog

OpenAI宣布,对其即将推出的模型Astra的内部评估表明,根据其准备框架,该模型可能达到关键网络能力,从而促使加强安全控制并暂停某些内部活动。