CyberFactory:利用野外实例扩展网络安全能力
摘要
CyberFactory 是一个开源框架,通过从现实世界漏洞工件构建可执行任务,并使用可验证的代理轨迹训练AI模型,来扩展网络安全能力。
查看缓存全文
缓存时间: 2026/08/26 11:11
论文页面 - CyberFactory:利用野外实例扩展网络安全能力
来源:https://huggingface.co/papers/2608.23181
https://huggingface.co/papers/2608.23181#%F0%9F%9B%A1%EF%B8%8F-cyberfactory-scaling-cyber-security-capabilities-with-instances-from-the-wild🛡️ CyberFactory:利用野外实例扩展网络安全能力
🏭 一个将真实世界漏洞产物转化为可执行任务、可验证的智能体轨迹以及内化网络安全工作流程的开源方案。
🔗 Hugging Face 合集 (https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactory) · 💻 GitHub (https://github.com/CSJianYang/CyberFactory)
https://huggingface.co/papers/2608.23181#%F0%9F%94%8D-what-is-cyberfactory🔍 什么是 CyberFactory?
网络安全智能体需要的不仅仅是静态的漏洞描述或最终答案。它们必须检查源代码、使用工具、与真实环境交互、解释执行反馈,并在长时间跨度内完善其决策。
CyberFactory 是一个统一的、开源的框架,它连接了:
- 🧱 实例构建:从公开漏洞产物(包括野外的 CVE)中构建可执行任务;
- 🤖 智能体轨迹合成:通过工具和环境交互,生成用于指导的轨迹;
- 🧠 模型训练:在概念验证生成、漏洞修补和网络安全问答任务上进行微调;
- ✅ 可执行验证:确保监督信号基于可观测的程序行为。
利用生成的轨迹,我们训练了 OpenAegis,一个从 Qwen3.5-397B-A17B 初始化的 397B-A17B 网络安全模型。
| 阶段 | CyberFactory 提供 | 输出 |
|---|---|---|
| 🧱 实例构建 | 从公开漏洞产物中重构可执行任务 | 概念验证、补丁和 CyberQA 实例 |
| 🧭 技能引导合成 | 引导教师模型进行源代码检查、领域指导分析和基于证据的验证 | 工具交互式智能体轨迹 |
| ✅ 验证 | 保留满足任务特定可执行标准的输出 | 基于事实的监督信号 |
| 🧠 模型训练 | 在验证过的轨迹上微调 Qwen3.5-397B-A17B | OpenAegis |
https://huggingface.co/papers/2608.23181#%E2%9C%A8-why-does-this-matter✨ 为什么这很重要?
现有的开源工作存在几个空白:
- 🔒 前沿的开源权重模型通常缺乏可复现的网络安全训练方案。
- 🧩 现有的训练方法通常针对孤立的任务,而非统一的能力。
- 📝 可用的监督信号很少能捕获完整的、工具交互式的智能体行为。
- 📈 简单的策略演进在缺乏强大的领域先验知识时难以扩展。
CyberFactory 通过一个端到端的方案来填补这些空白,用于创建可执行任务、合成可验证的智能体轨迹,并将工作流程迁移到模型参数中。
https://huggingface.co/papers/2608.23181#%F0%9F%8F%97%EF%B8%8F-from-vulnerability-artifacts-to-agentic-data🏗️ 从漏洞产物到智能体数据
CyberFactory 从 ARVO、OSS-Fuzz 和 野外的 CVE 构建概念验证任务。对于每个实例,它会重构存在漏洞的和已修补的程序状态,创建任务描述,并在轨迹合成和训练前移除特权验证信号。
一个概念验证候选只有在满足以下条件时才算成功:
- 💥 在修补前的构建版本中触发目标漏洞;并且
- 🩹 在修补后的构建版本中不会触发它。
这个差异化的验证器将漏洞复现变成了一个机器可检查的 提议 → 验证 → 完善 循环。
CyberFactory 还构建了:
- 🔧 补丁生成数据:基于漏洞修复记录;
- 📚 网络安全问答数据:通过一个基于执行结果、代码结构和权威报告的“答案优先”流程生成。
| 数据源 / 任务 | 构建过程 | 验证或依据 |
|---|---|---|
| 🧪 ARVO | 使用现有的漏洞和修补环境 | 真实的概念验证和差异执行 |
| 🐞 OSS-Fuzz | 定位对应的修复并重构程序状态 | 崩溃证据仅在实例验证时使用 |
| 🌍 野外的 CVE | 从受影响版本范围中定位修复提交,并构建修补前后环境 | 漏洞元数据用于验证,训练前移除 |
| 🔧 补丁生成 | 从漏洞修复记录构建实例 | 基于源代码级修复 |
| 📚 网络安全问答 | 从可信答案生成问题 | 基于执行、代码结构或报告的事实 |
https://huggingface.co/papers/2608.23181#%F0%9F%A7%AD-skill-guided-trajectory-synthesis🧭 技能引导的轨迹合成
我们在数据合成过程中为教师模型提供了一个可复用的漏洞分析技能。该技能编码了一个与任务无关的工作流程,用于:
- 🔎 检查目标及其构建约束;
- 🧪 应用领域指导的分析和测试;
- 📋 验证证据;
- 🔁 当验证失败时修改方法。
该技能不透露特定实例的解决方案。教师模型仍需通过与环境交互来解决每个漏洞,并且只有满足任务特定验证标准的轨迹才会被保留。
最重要的是,OpenAegis 在推理时并不接收该技能。监督微调将工作流程从技能引导的轨迹转移到模型参数中。
https://huggingface.co/papers/2608.23181#%F0%9F%93%8A-main-results📊 主要结果
在相同的脚手架和一小时的 CyberGym 预算下:
| 模型 | 参数量 | Pass@1 |
|---|---|---|
| Qwen3.5 | 397B-A17B | 29.6% |
| Kimi K2.7 | 1T-A32B | 51.7% |
| GLM 5.2 | 744B-A40B | 43.3% |
| OpenAegis | 397B-A17B | 58.1% |
🎯 OpenAegis 相比其基础模型 Qwen3.5 提升了 28.5 个百分点。 它也超过了 GLM 5.2(高出 14.8 个百分点)和 Kimi K2.7(高出 6.4 个百分点),同时使用的总参数和激活参数都比这两个模型少。
https://huggingface.co/papers/2608.23181#%F0%9F%A7%A0-from-skill-elicitation-to-skill-internalization🧠 从技能引导到技能内化
我们在两个阶段考察该技能:
https://huggingface.co/papers/2608.23181#%E2%9A%A1-explicit-skill-elicitation⚡ 显式技能引导
将漏洞分析技能添加到 GLM 5.2 中,即使每次尝试时间从 60 分钟缩短到 15 分钟,其 Pass@1 也从 43.3% 提高到 46.5%。由于设置不是计算量匹配的,此结果表明轨迹合成吞吐量更高,而非等计算量比较。
| GLM 5.2 配置 | 每次尝试时间 | 重复次数 | Pass@1 |
|---|---|---|---|
| 不带分析技能 | 60 | 1 | 43.3% |
| 带分析技能 | 15 | 5 | 46.5% |
| 行为指标 | GLM 5.2 | GLM 5.2 + 技能 |
|---|---|---|
| 探索覆盖率 | 3.78% | 99.85% |
| 每次轨迹的探索调用 | 0.05 | 2.06 |
| 验证覆盖率 | 0.13% | 98.41% |
| 每次轨迹的验证调用 | 0.001 | 2.17 |
| 每次 Shell 调用操作数 | 5.27 | 4.67 |
https://huggingface.co/papers/2608.23181#%F0%9F%8C%B1-training-time-internalization🌱 训练时内化
微调后出现了相同的行为趋势:
- 领域指导的探索成为 85.2% OpenAegis 轨迹中的主导策略,而 Qwen3.5 仅为 0.6%。
- 每次轨迹的探索调用从 0.01 增加到 1.32。
- 每次轨迹的验证调用从约 0 增加到 1.05。
- OpenAegis 使用了更强的工具链、更巩固的环境交互和更有选择性的提交行为。
这些结果串联起了完整的训练故事:
🧭 技能引导教师模型 → 🧾 验证过的轨迹捕获工作流程 → 🧠 微调将其内化 → 🚀 OpenAegis 在没有技能提示的情况下应用它
https://huggingface.co/papers/2608.23181#%F0%9F%A7%AD-dominant-strategy-distribution🧭 主导策略分布
第一对模型衡量 显式技能引导;第二对衡量 训练时内化。数值是互斥标签下轨迹的百分比。
| 策略 | GLM 5.2 | GLM 5.2 + 技能 | Qwen3.5 | OpenAegis |
|---|---|---|---|---|
| 领域先验指导的探索 | 2.6% | 99.7% | 0.6% | 85.2% |
| 直接设置 LibFuzzer | 32.1% | 0.0% | 60.8% | 5.6% |
| 手动构造输入 | 16.9% | 0.0% | 27.7% | 4.8% |
| 直接设置 AFL-Fuzz | 3.5% | 0.0% | 0.9% | 0.5% |
| 不进行模糊测试 | 44.8% | 0.1% | 8.3% | 3.4% |
ℹ️ 当显示的百分比总和不等于 100% 时,剩余部分对应未指定的策略;以上数值保留了论文中报告的百分比。
⚠️ GLM 5.2 + 技能的近乎完全转变也表明,推理时技能注入可能使教师过度依赖所提供的领域先验。OpenAegis 在保持更多样化策略分布的同时,也显示出相同的整体变化方向。
https://huggingface.co/papers/2608.23181#%F0%9F%A7%B0-domain-guided-operations🧰 领域指导的操作
| 指标(每次轨迹调用次数) | GLM 5.2 | GLM 5.2 + 技能 | Qwen3.5 | OpenAegis |
|---|---|---|---|---|
| 探索 | 0.05 | 2.06 | 0.01 | 1.32 |
| 验证 | 0.001 | 2.17 | 0.00 | 1.05 |
https://huggingface.co/papers/2608.23181#%E2%9A%99%EF%B8%8F-tool-use-and-command-complexity⚙️ 工具使用和命令复杂性
| 指标 | Qwen3.5 | OpenAegis |
|---|---|---|
| Shell 调用 | 70.1% | 89.9% |
| Read 调用 | 28.4% | 7.3% |
| 每次 Shell 调用操作数 | 2.7 | 5.5 |
| 单操作调用 | 31.4% | 13.5% |
| 6-10 个操作的调用 | 4.3% | 30.8% |
| 超过 10 个操作的调用 | 1.5% | 9.0% |
https://huggingface.co/papers/2608.23181#%F0%9F%94%AC-instrumentation-and-submission-discipline🔬 工具链使用与提交规范
| 指标 | Qwen3.5 | OpenAegis |
|---|---|---|
| ASAN 编译事件 | 155 | 1,795 |
| ASAN 输出检查 | 1,281 | 2,099 |
| 仅一次提交 | 37.9% | 48.2% |
| 至少五次提交 | 10.4% | 2.0% |
https://huggingface.co/papers/2608.23181#%F0%9F%97%9C%EF%B8%8F-long-horizon-context-management🗜️ 长时间跨度上下文管理
CyberGym 轨迹可能接近 256K token 的上下文限制。在 90% 上下文使用率时,CyberFactory 会将轨迹压缩到一个延续状态,保留已验证的证据、失败的尝试、待定的假设、生成的产物、构建状态和待处理操作。
| 上下文策略 | 整体 Pass@1 | 长时间跨度 Pass@1 | 上下文耗尽率 |
|---|---|---|---|
| 完整历史 | 52.1% | 40.2% | 18.7% |
| 简单截断 | 45.6% | 36.8% | 24.5% |
| 在 90% 时压缩 | 58.1% | 48.7% | 7.0% |
压缩触发阈值消融实验
| 触发阈值 | 整体 Pass@1 | 长时间跨度 Pass@1 | 上下文耗尽率 |
|---|---|---|---|
| 在 80% 时压缩 | 54.5% | 45.5% | 10.4% |
| 在 90% 时压缩 | 58.1% | 48.7% | 7.0% |
| 在 95% 时压缩 | 56.8% | 47.1% | 8.2% |
90% 压缩策略在整体和长时间跨度任务上都取得了最佳结果,同时显著减少了上下文耗尽的失败。
https://huggingface.co/papers/2608.23181#%F0%9F%93%A6-resources📦 资源
- 🤗 模型、数据与产物: Hugging Face 上的 CyberFactory (https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactory)
- 💻 代码与可复现流水线: CSJianYang/CyberFactory (https://github.com/CSJianYang/CyberFactory)
- 🛡️ 模型: OpenAegis
- 🧰 任务: 概念验证生成、漏洞修补和网络安全问答
https://huggingface.co/papers/2608.23181#%E2%9A%A0%EF%B8%8F-responsible-use⚠️ 负责任使用
CyberFactory 和 OpenAegis 的开发旨在支持防御性网络安全研究、可复现的评估、漏洞检查以及安全导向智能体的受控研究。用户应遵守适用法律,在测试系统前获得授权,并避免在没有所有权或许可评估的系统上部署。
https://huggingface.co/papers/2608.23181#%F0%9F%91%A5-authors👥 作者
Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, and Chengran Yang
🏫 北京航空航天大学 · ELLIS · IQuest Research · 新加坡管理大学
https://huggingface.co/papers/2608.23181#%F0%9F%92%AC-in-one-sentence💬 一句话总结
CyberFactory 通过将真实世界漏洞转化为可验证的智能体监督信号,使网络安全训练变得可复现——而 OpenAegis 则证明领域技能可以从轨迹中内化到模型行为中。 🛡️🤖
相似文章
@OpenAI:我们动员了250多人来加强数百个系统的防御。我们的最新网络安全模型帮助我们发现了……
OpenAI 推出了 Defense Factory,这是一个使用 AI 代理来持续发现和修复网络安全漏洞的自动化系统,并分享了其架构和操作见解。
Feyospace-v1:Cyber Mercury Seven如何训练前沿网络模型
一个以数据为中心的框架,包含五个专门系统,允许小团队训练开放权重的网络代理,在如CyberGym等基准测试套件上实现顶级性能。
@rohanpaul_ai: Codex代理在OpenAI的全公司安全冲刺中编写了数百个系统的每个补丁。OpenAI刚刚发布…
OpenAI发布了一份名为‘Defense Factory’的案例研究,描述了它如何在全公司安全冲刺中使用Codex代理和网络模型来查找和修复数百个系统的漏洞,分享了构建基于代理的持续安全循环的实用手册。
随着AI能力提升,强化网络防御能力
OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。
将前沿网络模型交给更值得信赖的机构
OpenAI正通过Daybreak Cyber Partner Program扩大其前沿网络模型的访问权限,让Accenture、CrowdStrike和Cloudflare等安全合作伙伴能够将先进AI集成到漏洞发现、验证和修复工作流程中。