CTIFoundry: 一个代理原生的网络威胁情报语料框架
摘要
CTIFoundry引入了一个代理原生的网络威胁情报语料框架,通过结构化本体图和程序性技能提升LLM代理的性能,在调查中实现更高的准确性和效率。
arXiv:2608.18613v1 公告类型:新
摘要:网络威胁情报(CTI)正越来越多地被大型语言模型代理而非人类分析师消费,这些代理在查询时组合多步调查。这一转变的工具侧已迅速成熟(规划循环、工具协议、上下文管理),但语料侧尚未:威胁报告和漏洞数据库仍然为检索增强生成而打包,作为嵌入索引后的不透明块。我们认为,这一基础而非模型能力,是代理CTI调查的瓶颈,并提出了CTIFoundry,一个代理原生的语料框架。在构建时,CTIFoundry将CTI语料库的潜在结构具象化:一个确定性本体图,覆盖四个权威知识库(CVE、CWE、CAPEC、ATT&CK),其官方交叉引用成为类型化、可遍历的边;一个基于跨度的报告层,其规范、别名解析的跨供应商实体索引带有来源的块;以及混合密集+词汇检索表面。在查询时,这一结构通过七个类型化工具和三个程序性技能暴露出来,这些工具和技能安装在一个标准的开源代理工具上。在公共CTIConnect基准测试上,仅交换操作表面就能使相同工具的代理在四个模型、两个提供商的面板中整体F1提升+0.19到+0.28:CTIFoundry上的小模型在平坦基底上超越了旗舰模型,并且这一增益不是以搜索努力为代价的,因为在两个Claude模型上,有框架的代理在大致一半的工具调用下更准确。一项消融研究将其归因:类型化结构承担了更大的份额,程序性技能将结构转化为纪律,两者超加性组合,因为技能仅绑定到存在的结构。
查看缓存全文
缓存时间: 2026/08/20 10:17
# 一种面向代理原生的网络威胁情报语料库脚手架
来源:https://arxiv.org/html/2608.18613
常泽·李、钱·崔、魏·丁\[2点\]
林志·王、燕·陈、鹏·高\[5点\]
弗吉尼亚理工大学、亚马逊、西北大学\[3点\]
\{yutongcheng, changzeli, penggao\}@vt\.edu
\{cuiqia, dingwe\}@amazon\.com\[1点\]
LingzhiWang2025@u\.northwestern\.edu
ychen@northwestern\.edu
###### 摘要
网络威胁情报(CTI)的消费主体正逐渐从人类分析师转向LLM代理,这些代理可在查询时构建多步骤调查。这一转变的工具端(规划循环、工具协议、上下文管理)已快速成熟,但语料库端却尚未跟进:威胁报告和漏洞数据库仍以检索增强生成(RAG)的方式打包,成为嵌入索引背后的不透明文本块。我们认为,这种底层结构而非模型能力,是当前代理式CTI调查的瓶颈,并据此提出**CTIFoundry**——一种*代理原生语料库脚手架*。
在构建阶段,CTIFoundry具象化CTI语料库的潜在结构:基于四个权威知识库(CVE、CWE、CAPEC、ATT&CK)构建确定性本体图,其官方交叉引用转化为可遍历的有类型边;建立基于文本片段的报告层,通过规范化的、别名解析的跨厂商实体索引携带来源信息的文本块;并提供混合密集与词汇检索接口。
在查询阶段,该结构通过七个类型化工具和三个过程化技能暴露,这些组件搭载在广泛使用的开源代理工具链上。在公开的CTIConnect基准测试(涵盖实体链接、归因和多文档综合的九项任务)中,仅通过替换操作接口,同一工具链下的代理在gpt-5.4上的整体F1从0.610提升至0.829,在claude-haiku-4-5上从0.470提升至0.745:小模型在CTIFoundry上的表现甚至超越了在平坦底座上的旗舰模型。这种准确度提升并非依赖更多搜索计算:在两个Claude模型上,带脚手架的代理以大约一半的工具调用次数实现了更高准确率。
消融研究揭示了收益来源:类型化结构贡献了主要提升,过程化技能将结构转化为规范操作,二者结合产生超加性效应;技能仅作用于已存在的结构。构建时验证保证零伪造标识符,该脚手架可支撑1,168次端到端调查,单次成本约2.6美分。
## 1 引言
网络威胁情报(CTI)调查本质上是多步骤过程。同一威胁行为者在不同厂商报告中可能以不同名称出现(*Lazarus*、*Hidden Cobra*、*APT38*),因此任何相关查询首先需要将别名解析为单一规范实体。随后,行为描述需链接到权威分类体系(CVE、CWE、CAPEC、ATT&CK),通常通过*官方交叉引用*实现:CVE记录会指明其对应的CWE弱点,CAPEC模式会说明其映射到的ATT&CK技术。而攻击活动概况则分散在各厂商报告中,各持片段。解析、遍历、收集、整合——这正是大型语言模型(LLM)代理擅长构建的工具介导流程。
交替进行的推理-行动循环(Yao等 2023)与习得式工具调用(Schick等 2023)已固化为开源代理工具链的通用栈(Yang & mini-swe-agent贡献者 2025;Anthropic 2024、2025b、2025a),而专用代理-计算机界面在其他领域也取得了显著成果(Yang等 2024)。
然而这种进展并不均衡。*工具链*随版本迭代不断改进,但将更强大的代理投入垂直领域并不意味着成为有效的领域调查者:代理继承了领域语料库原有的底层结构。在CTI领域,这种结构继承自检索增强生成(RAG),即单一相似性搜索接口背后的不透明文本块(Lewis等 2020),导致三个后果:厂商别名从未被解析,导致关于同一行为者的报告因名称不同而碎片化;权威回答实体链接问题的官方交叉引用仅以文本形式存在于记录块中;派生声明不包含文本片段级的溯源信息,因此无法区分权威交叉引用与文本共现。在代理之上修补这些问题无济于事:在不透明结构上迭代仅能重新检索,无法恢复索引时丢弃的结构。
公开的CTIConnect基准(Cheng等 2026b)衡量了这种影响,我们自己的测试显示,即使已检索到包含官方交叉引用的记录,现有工具链在平坦语料库上仍无法遵循此类引用(附录E.4)。我们将这些差距归纳为四个挑战(C1–C4,第2节),其核心约束在于*底层结构*而非代理本身。
我们提出CTIFoundry,一种代理原生语料库脚手架,包含两个部分。在*构建时*,它将语料库的潜在结构具象化为类型化、经验证的构件(表4):
- 确定性*本体图*:节点为四个权威知识库的条目,类型化边为官方交叉引用,在零伪造不变量下构建(C1);
- *基于文本片段的报告层*:以精确字符偏移溯源方式分割厂商报告,解析类型化提及(首先解析确定性信号),形成跨厂商规范实体并作为文本块的主键(C2);
- *混合检索表面*:融合密集搜索与词汇搜索,提供可调节术语过滤池的代理可引导过滤器(C3)。
在*查询时*,这些结构通过七个类型化工具暴露,每个工具覆盖一项非重叠能力,并附带使用指南和成本自述;同时提供三个过程化技能,编码调查规范:先解析后搜索、先遍历官方边再信文本相似度、验证每个候选对象(C4)。
我们采用严格控制的方法论在CTIConnect的九项任务上进行评估:两组实验均基于mini-swe-agent(Yang & mini-swe-agent贡献者 2025),基线组使用其原生bash工具处理转储为平坦文件的语料库,CTIFoundry组仅替换操作接口。循环、步数预算、温度和模型完全相同,因此任何差异都可归因于底层结构。替换操作接口后,整体F1在gpt-5.4上从0.610提升至0.829,在claude-haiku-4-5上从0.470提升至0.745,在四模型、双提供商测试中提升幅度为+0.19至+0.28(表2,图1(a))。
*结构形态*与结构规模同样重要:提升集中在基准测试揭示的RAG瓶颈任务上,在一项无需具象化权威结构的任务上提升消失。此外,结构部分替代了规模优势:CTIFoundry上的小模型表现超越了平坦文件上的旗舰模型,且这种提升并非依赖搜索计算:在两个Claude模型上,带脚手架的代理以大约一半的工具调用次数实现了更高准确率。
**贡献**
1. **底层结构瓶颈**。在固定第三方工具链且操作接口为唯一实验变量的条件下,我们证明代理式CTI调查的约束在于语料库底层结构而非代理能力:对平坦结构的迭代无法恢复其打包时丢弃的结构(第2节、4.1节)。
2. **代理原生语料库脚手架**。我们定义了脚手架与工具链的边界,并将其实现为构建时流水线(本体图、基于文本片段的规范实体、混合检索),在经验证的零伪造不变量下通过七个类型化工具和三个过程化技能暴露(第3节)。
3. **实证研究及泛化性**。九项任务中,替换操作接口使F1提升+0.19至+0.28,实现零伪造标识符且工具调用次数减半(第4节);2×2消融研究表明两部分产生超加性效应(4.5节);结构使正确调查成为可能,流程使其可靠,二者不可相互替代。该结论可推广至任何语料库具有权威参考结构的垂直领域。
## 2 背景与动机
实际CTI知识存在于两种形态迥异的来源中。四个社区维护的分类体系构成参考骨架(CVE[漏洞实例]、CWE[弱点类别]、CAPEC[攻击模式]、MITRE ATT&CK[攻击者技术]),关键在于它们并非四个独立列表,而是*官方交叉引用*:CVE记录会指明其对应的CWE弱点,CAPEC模式会说明其利用的CWE和映射的ATT&CK技术。对于大量分析师问题,这些策展边就是*权威答案*:“什么弱点导致该漏洞”不取决于文本相似度,而是已记录的边。
第二个来源是安全厂商编写的叙述层,其核心实体(威胁行为者、恶意软件家族、攻击活动)带有*厂商特定命名*,因此关于同一攻击活动的情报分散在名称不共享表面词汇的报告中(附录B)。CTIConnect(Cheng等 2026b)将此工作流操作化为公开基准,是目前唯一通过检索访问领域知识源而非闭卷方式评估LLM的CTI基准:包含1,859个经专家验证的问题,覆盖四个知识库加321份报告摘要,分为三个任务族的九项任务:*实体链接*(EL)、*实体归因*(EA)和*多文档综合*(MDS)。其评估局限于RAG场景,作者将语料库的代理式设计列为开放方向。
其公开诊断确定了*LLM在CTI中失败的位置*,我们基于该测量结果而非重复测试展开研究(附录C):跨源语义鸿沟随任务需跨越的异构性扩大,*别名*、*叙述文本与分类术语的语域失配*、*词法相近条目间的兄弟混淆*等问题将关键证据推过典型top-k窗口,这些是结构性失败而非偶然错误,因为通用检索改进仅能恢复词汇与实体结构干预所提升效果的一小部分。
结合实际CTI的两个附加要求(每项声明须可审计至厂商及断言该声明的句子;分析师的操作规范在语料库中无处记载),这要求代理面对的底层结构满足四项挑战,每项由CTIFoundry的一个组件应对:
- C1 **具象化潜在结构**。规范跨厂商别名和官方交叉引用必须成为类型化记录与可遍历边,而非通过相似性搜索重新发现的短语:从源头关闭别名与兄弟混淆鸿沟。⇒确定性本体图与规范实体层(3.2节)。
- C2 **为所有派生断言提供溯源依据**。提取的实体与基础信息必须回溯到带有厂商归属的精确源文本片段,以便代理(和构建验证器)进行验证而非盲信。⇒基于文本片段的块与零伪造验证机制(3.2节)。
- C3 **同时掌握两种检索语言**。密集搜索弥合释义差距;词汇过滤锚定罕见判别性词汇;CTI问题通常需要两者,且各自覆盖对方的失败模式——即上述度量的语域失配。⇒混合密集+BM25表面与可调节术语过滤器(3.2节)。
- C4 **随接口提供分析师操作规范**。先调用哪个工具、官方边何时优先于文本匹配、如何验证候选对象;这种规范具有语料库特异性,必须随脚手架提供,而非每次查询重新发现。⇒基于自述类型化工具的按任务族过程化技能(3.3节)。
CTIFoundry的构建时层应对C1-C3;查询时技能层应对C4。下文将详细阐述。
## 3 CTIFoundry
(a)引用说明(b)
图1:底层结构的作用及其产生机制。(a)同一工具链代理在平坦底座与CTIFoundry上按任务的F1值,每个模型一个雷达图(4.3节)。(b)CTIFoundry架构:构建时流水线与查询时表面(七个类型化工具及按任务族技能)(第3节)。
### 3.1 问题形式化
我们研究*代理原生语料库脚手架化*:给定领域语料库和固定代理循环,构建语料库的衍生表示及其操作表面,在不修改代理的前提下最大化调查准确度。每个已部署系统都已有此类表示,无论多简陋(平坦文件是退化形式,经典RAG的密集索引是弱形式,仅保留相似性几何而丢弃语料库携带的其他结构),因此变化的并非脚手架是否存在,而是语料库保持多少可达性。其上的代理循环日益成为通用组件(第5节),其下的语料库由领域决定;我们将这些固定。
**语料库**。CTI语料库为 \( C = R \cup K \),其中 \( R \) 是厂商报告集合(带厂商元数据的自由文本),\( K = K_{\text{cve}} \cup K_{\text{cwe}} \cup K_{\text{capec}} \cup K_{\text{att}} \) 是四个权威分类体系的知识库记录集合,每条记录带规范标识符及对其他分类体系的交叉引用。
###### 定义1(脚手架)
\( C \) 上的*脚手架*是衍生的、经验证的、索引化的表示,代理通过它访问语料库:
\( \mathsf{S}(C) = \big( G, X, \mathcal{E}, \Pi, \mathcal{I} \big) \),
其中:
- 本体图 \( G = (V, E) \) 包含知识库记录及其类型化官方交叉引用边;
- 携带溯源信息的*文本块* \( X \)(每个为带字符偏移的文档片段);
- *规范实体* \( \mathcal{E} \)(每个为报告提及的集群,带厂商归属别名集及可选的对 \( V \) 的基础指向);
- 实体索引 \( \Pi: \mathcal{E} \rightarrow 2^X \);
- 密集与词汇索引 \( \mathcal{I} \)。
若脚手架不伪造任何标识符,即 \( \mathrm{ids}(\mathsf{S}(C)) \subseteq \mathrm{ids}(C) \),则称其*可接受*。
###### 定义2(工具链与操作表面)
*工具链*是代理循环 \( L\langle m, b, A \rangle \):固定的控制程序……相似文章
用于检测AI生成证据的CIFAR合成证据语料库
本文介绍了CIFAR合成证据语料库,这是一个专门用于在法律背景下检测AI生成证据的数据集。该语料库涵盖多种文档类型和篡改策略,包含结构化元数据,并提供了一个用于评估检测系统的基准套件。
SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
Insights Generator:面向 LLM 智能体的系统性语料级轨迹诊断
本文介绍了 Insights Generator,一个用于 LLM 智能体系统性语料级轨迹诊断的多智能体系统。它通过在执行轨迹中提出并测试假设,生成有证据支撑的洞察。实验表明,使用 Insights Generator 报告可使脚手架性能提升 30.4 个百分点。
基础模型中的集体智能
本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。
@omarsar0: // OpenClaw-Skill: 搜索智能体技能树 // 如果你为智能体构建可复用的技能库,这篇值得一看…
本文介绍了集体技能树搜索(CSTS)这一框架,它利用多个模型的集体智慧,为LLM智能体构建结构化、多样且可泛化的技能树。由此产生的模型OpenClaw-Skill在长程规划、工具使用和泛化能力方面展现了更优的智能体性能。