COntExt:面向运营指标的上下文感知本体扩展

arXiv cs.AI 论文

摘要

COntExt 是一个用于上下文感知本体扩展的框架,它以结构化的运营指标定义作为输入,并建议如何将引用的概念和属性集成到现有本体中。对七个本体的评估表明,与本体上下文基线相比,从指标派生的上下文改善了关系类型预测和数据属性分配。

arXiv:2607.29553v1 公告类型:新 摘要:组织越来越多地以结构化的、机器可读的格式定义运营指标,以监控系统、流程和合规性。这些指标定义隐式地编码了领域知识,例如引用概念、属性和关系,这些往往超出了正式本体所捕获的内容。然而,运营指标目录与本体知识之间的联系仍然是手动的、临时的且劳动密集型的。我们提出了 COntExt,一个上下文感知本体扩展框架,它以结构化指标定义作为输入,并利用这些指标的上下文,建议如何将引用的概念和属性集成到现有本体中。该框架将扩展问题定义为三个子任务:父类预测、关系类型预测和数据属性分配。在四个网络安全本体上,我们评估了每个任务的不同算法。结果表明,对于关系类型预测和数据属性分配,从指标派生的上下文比本体上下文基线提供了更好的建议。我们的工作表明,运营指标目录是本体扩展的一个实用且未被充分利用的来源。这项工作使组织能够以远低于手动工程成本的方式维护其本体。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:32

# COntExt:面向基于运营指标的上下文感知本体扩展
Source: https://arxiv.org/html/2607.29553
Hussain Hussain1![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x1.png), Stefan Schöberl2![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x2.png), Angelika Schneider3![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x3.png)and Verena Geist2![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x4.png) 1Know Center Research GmbH, Graz, Austria 2Software Competence Center Hagenberg GmbH, Hagenberg im Mühlkreis, Austria 3Fraunhofer AISEC, Garching bei München, Germany hhussain@know\-center\.at, stefan\.schoeberl@scch\.at, angelika\.schneider@aisec\.fraunhofer\.de, verena\.geist@scch\.at ![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x5.png)https://orcid\.org/0000\-0002\-0959\-623X![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x6.png)https://orcid\.org/0009\-0006\-0245\-3558![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x7.png)https://orcid\.org/0000\-0002\-8962\-3276![[Uncaptioned image]](https://arxiv.org/html/2607.29553v1/x8.png)https://orcid\.org/0000\-0002\-3729\-1265

###### 摘要

组织越来越多地以结构化、机器可读的格式定义运营指标,以监控系统、流程和合规性。这些指标定义隐式地编码了领域知识,例如引用的概念、属性和关系,这些知识往往超出了正式本体所捕获的范围。然而,运营指标目录与本体知识之间的联系仍然是手动的、临时的且劳动密集型的。我们提出 COntExt,一个用于上下文感知本体扩展的框架,它以结构化指标定义为输入,并利用这些指标的上下文,建议如何将引用的概念和属性整合到现有本体中。该框架将扩展问题定义为三个子任务:父类预测、关系类型预测和数据属性分配。在涵盖四个领域的七个本体上,我们评估了每个任务的不同算法。结果表明,在关系类型预测和数据属性分配方面,指标派生的上下文比仅基于本体上下文的基线提供了更好的建议。我们的工作表明,运营指标目录是本体扩展的一个实用且未被充分开发的来源。这项工作使组织能够以远低于手动工程的成本维护其本体。

## 1 引言

动机。††预印本;精简版已被 KEOD 2026 接收。领域本体提供了正式的、共享的概念化,支持跨系统的互操作性、推理和知识重用。然而,在实践中,本体往往落后于它们所代表的领域。新的概念、属性和关系不断涌现,受到不断演变的法规、运营需求和技术变革的驱动 [Zablith et al., 2015 (https://arxiv.org/html/2607.29553#bib.bibx37),Elnagar et al., 2022 (https://arxiv.org/html/2607.29553#bib.bibx10)]。本体工程师必须手动识别这些差距并扩展本体,这个过程既需要领域专业知识,也需要知识工程技能。与此同时,许多组织已经在一种并行的、不太正式的制品中捕获了大量领域知识:结构化指标定义 [Van Looy and Shafagatova, 2016 (https://arxiv.org/html/2607.29553#bib.bibx34),Yu et al., 2026 (https://arxiv.org/html/2607.29553#bib.bibx36)]。指标定义以半结构化的人类可读形式表达,代表了自然语言文本与正式本体之间的重要中间制品。例如,一个网络安全团队可能会维护数百个基于 YAML 的指标定义,这些定义引用威胁类型、系统组件、合规属性及其关系,并且通常使用与组织领域本体高度相似的术语。然而,从本体维护的角度来看,这些隐式知识目前被丢弃了。

图 1:COntExt 框架示意图。该图展示了 COntExt 的输入,由本体模型和 .yaml 格式的运营指标文件表示。指标解析器识别概念(类和属性)的提及。识别出的概念随后传递给 COntExt,COntExt 执行相应任务:1) 预测识别出的类的父类,2) 预测一对类之间的关系类型,3) 预测拥有所提及属性的类。COntExt 的输出可用于更新本体。示例指标(见 [清单 1](https://

相似文章

OctoLong:跨仓库代码上下文的中间训练增强长上下文建模

arXiv cs.AI

引入了OctoLong,一个用于整理依赖丰富的跨仓库代码上下文的上下文工程流水线,以及OctoLong-Instruct,一套基于该数据训练的长上下文开放语言模型。实验表明,用OctoLong数据替换12%的传统长上下文语料,在长距离检索、状态跟踪、仓库级代码理解和智能体任务上带来了显著提升。

MoCA:隐式社会情境分析

arXiv cs.CL

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

上下文归因如何处理模型已知的知识

arXiv cs.CL

本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。