CyberFactory:利用野外实例扩展网络安全能力

Hugging Face Daily Papers 论文

摘要

CyberFactory 是一个开源框架,通过从现实世界漏洞工件构建可执行任务,并使用可验证的代理轨迹训练AI模型,来扩展网络安全能力。

随着大型语言模型(LLMs)在编码能力上的不断进步,其在网络安全方面的潜力引起了越来越多的研究关注,闭源LLMs(例如Mythos)提供了先进的网络安全能力。然而,现有的开源工作仍然有限:前沿的开放权重模型没有提供可复现的网络安全训练解决方案,开源训练解决方案专注于孤立的任务且缺乏可扩展的代理数据,并且扩展代理部署需要强大的领域先验。在本工作中,我们介绍了CyberFactory,一个统一的开源框架,连接了数据构建、轨迹合成和模型训练,涵盖概念验证(PoC)生成、漏洞修补和网络安全问答(CyberQA)。CyberFactory 将公共漏洞工件,包括来自野外的CVEs,转化为可执行和可验证的任务实例。它进一步使用可重用的漏洞分析技能来指导教师进行源码检查、基于领域先验的问题解决和基于证据的验证。由此产生的监督是代理式的:模型与工具和目标环境交互,并根据执行反馈修改其解决方案。利用这些轨迹,我们训练并发布了 \modelname\emph{Aegis 在希腊神话中是宙斯和雅典娜的保护盾;这个名字反映了该模型的防御性和安全导向目的。} 在CyberGym上,\modelname 在一小时预算下达到了52.4%的Pass@1,比其Qwen~3.5基础模型提高了22.8个百分点,并在相同支架下超越了评估的通用骨干。
查看原文
查看缓存全文

缓存时间: 2026/08/26 11:11

论文页面 - CyberFactory:利用野外实例扩展网络安全能力

来源:https://huggingface.co/papers/2608.23181

https://huggingface.co/papers/2608.23181#%F0%9F%9B%A1%EF%B8%8F-cyberfactory-scaling-cyber-security-capabilities-with-instances-from-the-wild🛡️ CyberFactory:利用野外实例扩展网络安全能力

🏭 一个将真实世界漏洞产物转化为可执行任务、可验证的智能体轨迹以及内化网络安全工作流程的开源方案。

🔗 Hugging Face 合集 (https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactory) · 💻 GitHub (https://github.com/CSJianYang/CyberFactory)

https://huggingface.co/papers/2608.23181#%F0%9F%94%8D-what-is-cyberfactory🔍 什么是 CyberFactory?

网络安全智能体需要的不仅仅是静态的漏洞描述或最终答案。它们必须检查源代码、使用工具、与真实环境交互、解释执行反馈,并在长时间跨度内完善其决策。

CyberFactory 是一个统一的、开源的框架,它连接了:

  • 🧱 实例构建:从公开漏洞产物(包括野外的 CVE)中构建可执行任务;
  • 🤖 智能体轨迹合成:通过工具和环境交互,生成用于指导的轨迹;
  • 🧠 模型训练:在概念验证生成、漏洞修补和网络安全问答任务上进行微调;
  • 可执行验证:确保监督信号基于可观测的程序行为。

利用生成的轨迹,我们训练了 OpenAegis,一个从 Qwen3.5-397B-A17B 初始化的 397B-A17B 网络安全模型。

阶段CyberFactory 提供输出
🧱 实例构建从公开漏洞产物中重构可执行任务概念验证、补丁和 CyberQA 实例
🧭 技能引导合成引导教师模型进行源代码检查、领域指导分析和基于证据的验证工具交互式智能体轨迹
验证保留满足任务特定可执行标准的输出基于事实的监督信号
🧠 模型训练在验证过的轨迹上微调 Qwen3.5-397B-A17BOpenAegis

https://huggingface.co/papers/2608.23181#%E2%9C%A8-why-does-this-matter✨ 为什么这很重要?

现有的开源工作存在几个空白:

  • 🔒 前沿的开源权重模型通常缺乏可复现的网络安全训练方案。
  • 🧩 现有的训练方法通常针对孤立的任务,而非统一的能力。
  • 📝 可用的监督信号很少能捕获完整的、工具交互式的智能体行为。
  • 📈 简单的策略演进在缺乏强大的领域先验知识时难以扩展。

CyberFactory 通过一个端到端的方案来填补这些空白,用于创建可执行任务、合成可验证的智能体轨迹,并将工作流程迁移到模型参数中。

https://huggingface.co/papers/2608.23181#%F0%9F%8F%97%EF%B8%8F-from-vulnerability-artifacts-to-agentic-data🏗️ 从漏洞产物到智能体数据

CyberFactory 从 ARVOOSS-Fuzz野外的 CVE 构建概念验证任务。对于每个实例,它会重构存在漏洞的和已修补的程序状态,创建任务描述,并在轨迹合成和训练前移除特权验证信号。

一个概念验证候选只有在满足以下条件时才算成功:

  1. 💥 在修补前的构建版本中触发目标漏洞;并且
  2. 🩹 在修补后的构建版本中不会触发它。

这个差异化的验证器将漏洞复现变成了一个机器可检查的 提议 → 验证 → 完善 循环。

CyberFactory 还构建了:

  • 🔧 补丁生成数据:基于漏洞修复记录;
  • 📚 网络安全问答数据:通过一个基于执行结果、代码结构和权威报告的“答案优先”流程生成。
数据源 / 任务构建过程验证或依据
🧪 ARVO使用现有的漏洞和修补环境真实的概念验证和差异执行
🐞 OSS-Fuzz定位对应的修复并重构程序状态崩溃证据仅在实例验证时使用
🌍 野外的 CVE从受影响版本范围中定位修复提交,并构建修补前后环境漏洞元数据用于验证,训练前移除
🔧 补丁生成从漏洞修复记录构建实例基于源代码级修复
📚 网络安全问答从可信答案生成问题基于执行、代码结构或报告的事实

https://huggingface.co/papers/2608.23181#%F0%9F%A7%AD-skill-guided-trajectory-synthesis🧭 技能引导的轨迹合成

我们在数据合成过程中为教师模型提供了一个可复用的漏洞分析技能。该技能编码了一个与任务无关的工作流程,用于:

  • 🔎 检查目标及其构建约束;
  • 🧪 应用领域指导的分析和测试;
  • 📋 验证证据;
  • 🔁 当验证失败时修改方法。

该技能不透露特定实例的解决方案。教师模型仍需通过与环境交互来解决每个漏洞,并且只有满足任务特定验证标准的轨迹才会被保留。

最重要的是,OpenAegis 在推理时并不接收该技能。监督微调将工作流程从技能引导的轨迹转移到模型参数中。

https://huggingface.co/papers/2608.23181#%F0%9F%93%8A-main-results📊 主要结果

在相同的脚手架和一小时的 CyberGym 预算下:

模型参数量Pass@1
Qwen3.5397B-A17B29.6%
Kimi K2.71T-A32B51.7%
GLM 5.2744B-A40B43.3%
OpenAegis397B-A17B58.1%

🎯 OpenAegis 相比其基础模型 Qwen3.5 提升了 28.5 个百分点。 它也超过了 GLM 5.2(高出 14.8 个百分点)和 Kimi K2.7(高出 6.4 个百分点),同时使用的总参数和激活参数都比这两个模型少。

https://huggingface.co/papers/2608.23181#%F0%9F%A7%A0-from-skill-elicitation-to-skill-internalization🧠 从技能引导到技能内化

我们在两个阶段考察该技能:

https://huggingface.co/papers/2608.23181#%E2%9A%A1-explicit-skill-elicitation⚡ 显式技能引导

将漏洞分析技能添加到 GLM 5.2 中,即使每次尝试时间从 60 分钟缩短到 15 分钟,其 Pass@1 也从 43.3% 提高到 46.5%。由于设置不是计算量匹配的,此结果表明轨迹合成吞吐量更高,而非等计算量比较。

GLM 5.2 配置每次尝试时间重复次数Pass@1
不带分析技能60143.3%
带分析技能15546.5%
行为指标GLM 5.2GLM 5.2 + 技能
探索覆盖率3.78%99.85%
每次轨迹的探索调用0.052.06
验证覆盖率0.13%98.41%
每次轨迹的验证调用0.0012.17
每次 Shell 调用操作数5.274.67

https://huggingface.co/papers/2608.23181#%F0%9F%8C%B1-training-time-internalization🌱 训练时内化

微调后出现了相同的行为趋势:

  • 领域指导的探索成为 85.2% OpenAegis 轨迹中的主导策略,而 Qwen3.5 仅为 0.6%
  • 每次轨迹的探索调用从 0.01 增加到 1.32
  • 每次轨迹的验证调用从约 0 增加到 1.05
  • OpenAegis 使用了更强的工具链、更巩固的环境交互和更有选择性的提交行为。

这些结果串联起了完整的训练故事:

🧭 技能引导教师模型 → 🧾 验证过的轨迹捕获工作流程 → 🧠 微调将其内化 → 🚀 OpenAegis 在没有技能提示的情况下应用它

https://huggingface.co/papers/2608.23181#%F0%9F%A7%AD-dominant-strategy-distribution🧭 主导策略分布

第一对模型衡量 显式技能引导;第二对衡量 训练时内化。数值是互斥标签下轨迹的百分比。

策略GLM 5.2GLM 5.2 + 技能Qwen3.5OpenAegis
领域先验指导的探索2.6%99.7%0.6%85.2%
直接设置 LibFuzzer32.1%0.0%60.8%5.6%
手动构造输入16.9%0.0%27.7%4.8%
直接设置 AFL-Fuzz3.5%0.0%0.9%0.5%
不进行模糊测试44.8%0.1%8.3%3.4%

ℹ️ 当显示的百分比总和不等于 100% 时,剩余部分对应未指定的策略;以上数值保留了论文中报告的百分比。

⚠️ GLM 5.2 + 技能的近乎完全转变也表明,推理时技能注入可能使教师过度依赖所提供的领域先验。OpenAegis 在保持更多样化策略分布的同时,也显示出相同的整体变化方向。

https://huggingface.co/papers/2608.23181#%F0%9F%A7%B0-domain-guided-operations🧰 领域指导的操作

指标(每次轨迹调用次数)GLM 5.2GLM 5.2 + 技能Qwen3.5OpenAegis
探索0.052.060.011.32
验证0.0012.170.001.05

https://huggingface.co/papers/2608.23181#%E2%9A%99%EF%B8%8F-tool-use-and-command-complexity⚙️ 工具使用和命令复杂性

指标Qwen3.5OpenAegis
Shell 调用70.1%89.9%
Read 调用28.4%7.3%
每次 Shell 调用操作数2.75.5
单操作调用31.4%13.5%
6-10 个操作的调用4.3%30.8%
超过 10 个操作的调用1.5%9.0%

https://huggingface.co/papers/2608.23181#%F0%9F%94%AC-instrumentation-and-submission-discipline🔬 工具链使用与提交规范

指标Qwen3.5OpenAegis
ASAN 编译事件1551,795
ASAN 输出检查1,2812,099
仅一次提交37.9%48.2%
至少五次提交10.4%2.0%

https://huggingface.co/papers/2608.23181#%F0%9F%97%9C%EF%B8%8F-long-horizon-context-management🗜️ 长时间跨度上下文管理

CyberGym 轨迹可能接近 256K token 的上下文限制。在 90% 上下文使用率时,CyberFactory 会将轨迹压缩到一个延续状态,保留已验证的证据、失败的尝试、待定的假设、生成的产物、构建状态和待处理操作。

上下文策略整体 Pass@1长时间跨度 Pass@1上下文耗尽率
完整历史52.1%40.2%18.7%
简单截断45.6%36.8%24.5%
在 90% 时压缩58.1%48.7%7.0%

压缩触发阈值消融实验

触发阈值整体 Pass@1长时间跨度 Pass@1上下文耗尽率
在 80% 时压缩54.5%45.5%10.4%
在 90% 时压缩58.1%48.7%7.0%
在 95% 时压缩56.8%47.1%8.2%

90% 压缩策略在整体和长时间跨度任务上都取得了最佳结果,同时显著减少了上下文耗尽的失败。

https://huggingface.co/papers/2608.23181#%F0%9F%93%A6-resources📦 资源

  • 🤗 模型、数据与产物: Hugging Face 上的 CyberFactory (https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactory)
  • 💻 代码与可复现流水线: CSJianYang/CyberFactory (https://github.com/CSJianYang/CyberFactory)
  • 🛡️ 模型: OpenAegis
  • 🧰 任务: 概念验证生成、漏洞修补和网络安全问答

https://huggingface.co/papers/2608.23181#%E2%9A%A0%EF%B8%8F-responsible-use⚠️ 负责任使用

CyberFactory 和 OpenAegis 的开发旨在支持防御性网络安全研究、可复现的评估、漏洞检查以及安全导向智能体的受控研究。用户应遵守适用法律,在测试系统前获得授权,并避免在没有所有权或许可评估的系统上部署。

https://huggingface.co/papers/2608.23181#%F0%9F%91%A5-authors👥 作者

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, and Chengran Yang

🏫 北京航空航天大学 · ELLIS · IQuest Research · 新加坡管理大学

https://huggingface.co/papers/2608.23181#%F0%9F%92%AC-in-one-sentence💬 一句话总结

CyberFactory 通过将真实世界漏洞转化为可验证的智能体监督信号,使网络安全训练变得可复现——而 OpenAegis 则证明领域技能可以从轨迹中内化到模型行为中。 🛡️🤖

相似文章

随着AI能力提升,强化网络防御能力

OpenAI Blog

OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。

将前沿网络模型交给更值得信赖的机构

OpenAI Blog

OpenAI正通过Daybreak Cyber Partner Program扩大其前沿网络模型的访问权限,让Accenture、CrowdStrike和Cloudflare等安全合作伙伴能够将先进AI集成到漏洞发现、验证和修复工作流程中。