@OpenAI:我们动员了250多人来加强数百个系统的防御。我们的最新网络安全模型帮助我们发现了……

X AI KOLs 工具

摘要

OpenAI 推出了 Defense Factory,这是一个使用 AI 代理来持续发现和修复网络安全漏洞的自动化系统,并分享了其架构和操作见解。

我们动员了250多人来加强数百个系统的防御。我们的最新网络安全模型帮助我们发现并修复了那些我们可能永远无法发现的漏洞。 我们分享了我们的学习成果、架构和一个实用手册,以便您构建自己的 Defense Factory:一个由 AI 代理发现漏洞、验证它们并确认修复有效的持续循环。 https://openai.com/the-defense-factory/…
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:45

我们动员了250多人,在数百个系统中强化我们的防御。我们最新的网络模型帮助我们发现并修复了那些原本可能永远发现不了的漏洞。

我们将分享我们学到的经验、架构以及实用的操作手册,以便你们能构建自己的防御工厂:一个持续的闭环,让AI智能体发现漏洞、验证漏洞,并确认修复措施有效。

https://openai.com/the-defense-factory/…


防御工厂 | OpenAI

来源:https://openai.com/the-defense-factory/ 防御者的窗口正在关闭

防御者有先机,但必须立即行动

OpenAI 的方法

防御工厂

构建持续防御

仅靠传统网络安全防御已不足够

智能体现在可以通过滥用日益普及的开放权重模型来进行长时间的网络操作。作为回应,OpenAI 正在构建一个防御工厂。这是一个自动化的防御行动,旨在持续地发现、验证和修复漏洞。

Cloudflare(在新窗口打开)(https://blog.cloudflare.com/build-your-own-vulnerability-harness/)、Ramp(在新窗口打开)(https://engineering.ramp.com/post/100-vulnerabilities-patched-with-0-humans) 和 Google(在新窗口打开)(https://blog.google/security/chrome-stronger-with-every-update/) 的团队也在探索这种方法。在此,我们将分享我们自身防御工厂背后的架构和流程,以及我们在构建过程中所学到的经验。

最新前沿模型已在生产环境中发现漏洞

在最近的一次安全冲刺中,我们使用最新的网络模型在 OpenAI 内部发现、验证并修复了漏洞。我们动员了250多人,并以处理紧急事件般的紧迫感投入工作。

相比峰值周,有连续五周选定的紧急和高危漏洞报告被标记为“完成”或“已解决”。记录的完成情况并不等于已独立验证部署了修复措施。P0/P1修复措施 P0/P1修复措施 54 63 14 9 1 5 3 5 周

智能体现在可以链接利用漏洞

智能体可以在会话间保留所学知识,从而对系统形成详细的理解并连接起弱点。以前难以实施的复杂攻击现在可以自主进行。

示例攻击链一条路径通过迷宫连接连续节点。每个到达的节点都使下一步成为可能,且先前的步骤仍保持连接。这是一个概念性示意图,并非对某次事件的复原。

智能体集群倍增了攻击规模

在集群中运行的长时间智能体,可以在更大规模上利用弱点,并且远在人类在环的安全响应能够发现并修补相同漏洞之前就已实施。

模型与智能体在速度上趋同广泛可用的模型和长时间智能体在顶部相连。两条轨迹向下延伸至机器速度的利用,随着它们的到达从上到下填充。标签在整个过程中保持可见。

防御者有先机,但必须立即行动

防御者有两个结构性优势。他们可以直接让智能体访问其代码,并使用前沿模型,相对于那些滥用广泛可用开放权重模型的攻击者获得先机。

网络能力

达到前沿,然后保持同步网络能力向上增长;时间向右移动。前沿和广泛扩散的模型能力持续加速。在实施持续防御之前,防御能力保持平稳。随后它呈S型曲线攀升:逐步进展、快速提升,然后与前沿能力平滑衔接。防御曲线与前沿曲线相遇,随后共享同一条上升轨迹。已部署防御能力与广泛扩散能力之间的蓝色区域即为防御者的窗口。保持同步需要持续的工作。这些是示意性轨迹,并非测量结果或预测。时间

  • 前沿
  • 防御者能力
  • 广泛扩散

实施持续防御

防御者的窗口

这个先机就是防御者的窗口。

防御工厂 (https://openai.com/the-defense-factory/#the-defense-factory)OpenAI 案例研究 (https://openai.com/the-defense-factory/#openai-case-study)参考架构 (https://openai.com/the-defense-factory/#reference-architecture)入门指南 (https://openai.com/the-defense-factory/#getting-starting)防御工厂是一个持续的、以智能体为先的操作,用于发现和修复漏洞。它帮助防御者保持同步,以应对攻击者滥用日益强大的开放权重模型来加速其行动。智能体使用现有的安全和工程工具,可复用技能定义它们遵循的工作流,而隔离的、可复现的环境让智能体能够调查发现并准备经过测试的修复方案以供审查。团队逐步自动化更多流程,减少交接环节,缩短从发现到修复的时间。

传统安全

您现有的工具,理想情况下通过MCP、CLI或API让智能体可访问。

版本控制

GitHub · GitLab

安全工具

Snyk · Semgrep · Tenable

问题与工作流

Jira · Linear · ServiceNow

防御工厂

连接您现有工具的粘合剂,使智能体能在持续的工作流中主动发现和修复漏洞。

开发环境

隔离的、可复现的环境 · Ona, Cloudflare, Modal

智能体

  • Codex Desktop
  • Codex CLI
  • Codex Security CLI

安全技能

安全扫描 · 分类发现 · 修复发现

自定义技能

通用模型

Astra · Sol · Terra · Luna

安全模型

Daybreak Blue · Daybreak Red

在私有网络内,开发者系统和状态存储与控制平面和数据平面并存。控制平面包含工作负载编排、策略执行和凭证代理。数据平面包含带有开发容器、环境身份和主机监控的开发环境。每个开发容器都包含一个智能体框架、技能和应用程序。安全和审计通过主机活动、基础设施安全和智能体审计对整个系统进行监督。方框显示组件和边界。

防御工厂如何增强传统安全

水平滚动以查看工厂新增部分。

防御闭环

  1. 01 #### 资产清单 映射、链接、更新
  2. 02 #### 发现扫描 扫描、分析、导入
  3. 03 #### 动态验证 复现、测试、确认
  4. 04 #### 归属分配 识别、路由、跟进
  5. 05 #### 已验证修复 打补丁、部署、验证

学习、适应并增加自主性

SECURITY.md共享上下文

SECURITY.md 代表共享的系统上下文,而不是闭环中的另一步骤。资产清单、发现、动态验证、归属分配和已验证修复每个环节都会读取现有上下文,并贡献其所学。每一次遍历都会复用系统映射、归属信息、调查证据和已建立的检查项,这样后续遍历就可以专注于变更和未解决的风险,而不是从头开始。人们会审查重大变更并独立验证已部署的修复措施。脉动图示表示上下文贡献,而非测量进度或节省量。

我们在构建防御闭环中学到的经验

防御闭环需要合适的开发环境

可复现的开发环境是自主防御闭环的基础。智能体需要能够大规模自动配置的隔离环境,具备复现漏洞和测试修复所需的服务、依赖项和配置。这些环境必须是临时性的,每次运行都创建新的,并在事后丢弃其状态,以免一次运行污染下一次运行。

自主性必须从手动步骤开始逐步建立

我们从少量批次和人工审查开始,然后随着结果获得信任而移除了重复的手动步骤。我们扩大了智能体可以独立完成的工作量,与它们被允许更改的内容分开。随着智能体承担更多日常工作,人们转向设置边界、处理异常和检查结果。

  • 在修复开始的同时进行资产清单编制我们从绘制系统地图开始。Codex 帮助构建清单,同时我们将现有发现汇总到一个共享待办事项列表中。早期的归属查找仍然依赖于人们找到正确的团队。我们将服务和所有权信息转化为可复用的输入,以便智能体可以对成批问题进行标记和路由,由人处理模糊情况。这将我们接受的归属分配准确率提高到了90.6%。与此同时,团队在清单和归属模型完成之前就处理了紧急问题。我们在第一天就解决了系统中的53个紧急或高优先级问题。

  • 构建并改进智能体分类能力Codex 根据严重性标准评估成批发现,并添加服务和所有者上下文。早期的严重性标签过于宽泛,分类结果因智能体收到的指令而异。我们对标准和提示进行了版本管理,添加了可重复的评估,并记录了审查员的预期优先级和推理过程。人工抽查帮助优化优先级并发现薄弱或重复的报告。我们还暂停了路由,直到去重功能改进,进展从一个小而经过审查的批次到重复运行,将37%的发现识别为重复问题。

  • 使运行时验证可复现为智能体构建隔离环境以运行代码、评估严重性并过滤误报,是从信号中分离出噪音的关键一步。但环境配置成为验证的制约因素,因此我们从可以反复运行选定的服务开始。我们处理了缺失的依赖项和配置差异,以便能够区分未复现的发现和无法正常运行的测试。经过这些改进,19.5%的发现在运行时得以复现,动态验证后的误报率为0.81%。

  • 引入补丁自动化并构建可复用工作流修复工作完全基于Codex,由智能体生成补丁,而我们则改进路由和优先级。我们为智能体提供可复现的开发环境,以复现问题并在运行的服务上测试拟议的补丁,同时检查安全修复及其对正常行为的影响。我们将经验教训记录在SECURITY.md文件和可复用技能中,并在自动化修复检查的同时扩展了智能体运行的扫描和分类。后续检查暴露了已合并的补丁与已部署到整个集群的修复之间的差距。经过小范围试验后,我们扩大了验证范围并在确认的修复上发布评论,同时在解决如何处理部署延迟的问题之前,关闭了自动重新开启功能。

技术博客文章即将发布

资产清单 发现 动态验证 归属分配 已验证修复

资产清单

智能体将云记录、部署配置和服务归属数据协调成一份资产清单。它们将暴露的端点与代码和所有者联系起来,保留证据和差距,使发现工作能从更清晰的范围开始。

水平滚动以探索图表。

云与资产记录、源代码与部署配置,以及服务与所有者数据共同输入可复现的开发环境。Codex 使用提议的构建和更新清单技能以及现有的服务归属参考来生成资产清单。同一清单是发现的第一个输入。清单写入和刷新调度必须由调用工作流配置。

输入

智能体工作流

可复现的开发环境

输出

  • 第三方平台
  • 制品
  • OpenAI 产品
  • 技能/插件
  • 环境

将持续防御列为优先事项

向你的团队做简报,从一个工作流开始,逐步构建你的防御工厂。我们将继续发布在 OpenAI 学到的经验,以及实用的工作流、工具和指南。

  1. 向你的团队做简报使用简报材料来论证建立防御工厂的必要性,设定方向,并商定第一个工作流。获取简报材料(在新窗口打开)(https://cdn.openai.com/defense-factory/downloads/defense-factory-playbook.pdf)

  2. 申请网络模型访问向 Daybreak 申请,获取 OpenAI 高级网络模型的权限,用于授权的防御工作。申请 Daybreak(在新窗口打开)(https://openai.com/form/enterprise-trusted-access-for-cyber/)

  3. 运行一个工作流使用 Codex Security 插件中的技能来发现漏洞、验证发现并准备修复方案。尝试 Codex Security(在新窗口打开)(https://learn.chatgpt.com/docs/security/plugin)

已经是 OpenAI 客户了?与您的客户经理讨论您的架构。

延伸阅读

Hugging Face 事件Black Hat 演讲背后的 Hugging Face 事件重建。(在新窗口打开)(https://youtu.be/87DyyMV0kCY)1. 事件分析 2026年7月27日智能体入侵:技术时间线Hugging Face 对入侵的取证报告,包括攻击路径、调查和防御变更。(在新窗口打开)(https://huggingface.co/blog/agent-intrusion-technical-timeline)

  1. 事件披露 2026年7月21日Hugging Face 模型评估安全事件OpenAI 对模型评估事件、与 Hugging Face 的响应以及评估安全措施变更的说明。(在新窗口打开)(https://openai.com/index/hugging-face-model-evaluation-security-incident/)
  2. 观点 2026年8月17日防御者的窗口为什么防御者的行动窗口有限,以及组织如何利用AI加强网络防御。(在新窗口打开)(https://openai.com/index/the-defenders-window/)
  3. 项目更新 2026年8月10日随着网络防御窗口缩小,扩展Daybreak项目Daybreak如何扩展对高级网络模型的访问,并在适当的安全保障下帮助防御者使用它们。(在新窗口打开)(https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/)
  4. 文档 ChatGPT LearnCodex Security 插件安装 Codex Security 插件、扫描代码库以及查看安全发现的指南。(在新窗口打开)(https://learn.chatgpt.com/docs/security/plugin)

相似文章

随着AI能力提升,强化网络防御能力

OpenAI Blog

OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。