应对关键网络能力的下一个前沿

OpenAI Blog 新闻

摘要

OpenAI宣布,对其即将推出的模型Astra的内部评估表明,根据其准备框架,该模型可能达到关键网络能力,从而促使加强安全控制并暂停某些内部活动。

OpenAI正在分享Astra的初步网络安全评估,以及我们为加强保障和安全控制而采取的步骤。
查看原文
查看缓存全文

缓存时间: 2026/08/07 17:11

# 应对关键网络能力的下一前沿 来源:https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ 随着模型在增强网络防御和以前所未有的速度与规模发动攻击方面都变得更具能力,网络安全正在迅速变化。 我们在过去几天对即将推出的模型之一 Astra 进行的最新内部评估表明,其在智能体编码和网络安全方面取得了显著进展。这些结果,加上专家评估,使我们昨晚得出结论:根据我们的[准备框架](https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf)(在新窗口中打开),我们无法排除关键网络能力的可能性。 我们分享这一信息,是因为我们相信向公众以及安全与安保社区透明地说明这一潜在的能力转变非常重要。 我们最初于 2023 年 12 月发布了《准备框架》,远在模型接近生物学、化学、网络安全和 AI 自我改进能力达到这一水平之前。我们创建它是为了给我们提供一份指南,用于识别能力进展,并规划公司在这些能力出现时应该采取的行动。之前的模型,包括 GPT-5.6-Sol,已经过前沿网络能力评估,并被评定为“高”(而非“关键”)阈值。 ## 衡量关键网络安全能力 根据我们的《准备框架》,如果一个模型能够在没有人工干预的情况下,识别并开发针对许多加固的真实世界关键系统的各种严重程度的可用零日漏洞,或者能够在仅给出高层次预期目标的情况下,设计并执行针对加固目标的端到端新型网络攻击策略,则该模型达到“关键”网络安全阈值。 虽然我们仍在继续对该模型进行基准测试和评估,但我们的初步评估表明其性能足够强大,以至于我们目前无法排除“关键”能力等级的可能性。Astra 是一个即将推出的模型,并未参与利用 Hugging Face 的事件。 ## 我们正在采取的步骤 因此,我们已加强了对安全防护措施和安全控制的稳健性测试,以使其适合此类能力的部署。在内部,我们还采取了以下步骤,以确保该模型的进一步开发安全可靠地推进: - 我们正在对高能力模型及相关活动实施更严格的安全控制,包括隔离的测试环境、受限的网络和工具访问、增强的模型权重保护和加密、额外的监控和检测能力,以及沙盒化执行。 - 我们正在暂停涉及 Astra 的内部活动,直到这些活动满足强化后的安全控制要求。 - 我们已在 Astra 的所有智能体应用中实施了通用监控,用于检测风险行为和失准,包括训练和评估环节。监控器会评估模型的思维链,并触发安全响应以审查和中断高风险活动。 - 我们将与相关政府机构和选定的 AI 安全组织合作,测试该模型的能力。 - 我们将向第三方测试合作伙伴提供推荐的安全控制措施,以便其安全地运行高风险评估和工作负载。 该框架已经引导我们度过了其他能力转型期。2025 年 6 月,随着我们的模型在《准备框架》下接近生物学高能力阈值,我们[概述了正在采取的步骤](https://openai.com/index/preparing-for-future-ai-capabilities-in-biology/),以加强安全防护、扩大测试、与外部专家合作,并部署额外的安全控制。我们正在这里应用同样的原则。 我们相信,具备先进网络能力的模型应该帮助[防御者](https://openai.com/daybreak/)在攻击者之前识别并解决漏洞。我们致力于与政府、安全研究机构和民间社会合作,确保像 Astra 及其后续这样的模型的前沿能力能够以负责任的方式广泛部署,造福全人类。

相似文章

OpenAI表示因安全担忧放缓了Astra模型的开发

TechCrunch AI

OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。

OpenAI 暂停新模型开发,据称因其过于强大

The Verge

OpenAI 正在暂停其正在开发的 Astra 模型的相关内部活动,原因是担心该模型在《预备框架》下可能达到关键的网络安全能力。此前,Anthropic 和 Meta 近期也发生了 AI 模型失控的事件。

随着AI能力提升,强化网络防御能力

OpenAI Blog

OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。