Knowledge Cards:AI系统的结构化知识

arXiv cs.AI 论文

摘要

本文介绍了知识卡片(Knowledge Card),这是一种结构化且经过专家验证的工件,旨在表示AI系统中的知识,特别是对于代理AI,以增强透明度和可审计性。

arXiv:2608.26176v1 公告类型:新 摘要:那些输出影响实际决策,且日益关键的AI系统,需要一些当前文档实践未能提供的东西:一种结构化的、可检查的知识表示,用于支撑、情境化并推理这些决策,理想情况下由领域专家审查和签署。现有的文档工件已经捕获了AI系统的重要方面。模型卡片描述系统如何行为,数据卡片描述其训练数据,系统卡片描述部署系统的风险。但它们都没有解决输入和输出之间的层次,更精确地说,是系统持有的概念、建模的关系以及应用的推理模式。对于模式识别任务,这种差距是可以容忍的。对于代理AI,即系统根据其结论行动,这一步通常是有前途的概念验证与组织可依赖的运营解决方案之间的分水岭。本文介绍了Knowledge Card,这是一种结构化的工件,以专家可以审查、组织可以审计、AI系统可以推理的形式,捕获关于单个有界概念的验证知识。对于一个概念,如特定故障模式、合规义务或过程决策,Knowledge Card记录涉及的实体和关系、连接它们的推理、该推理不再成立的条件,以及每个主张的来源,所有这些都基于正式的领域本体论,并由领域专家签署。初始原型卡片已在能源和制药领域构建。该模式作为公共草案发布,以供社区参与。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:30

# AI系统的结构化知识
来源:https://arxiv.org/html/2608.26176
(2026年7月)

###### 摘要

其输出影响真实决策(且日益关键)的AI系统,需要当前文档实践尚未提供的某种东西:一种结构化、可检查的知识表示形式,用以支撑、情境化并推理这些决策,理想情况下应由领域专家审阅并签署确认。现有的文档制品已能捕捉AI系统的重要方面。模型卡描述系统行为,数据卡描述训练数据,系统卡描述已部署系统的风险。但它们都没有触及输入与输出之间的那个层面——更准确地说,是系统所持有的概念、它所建模的关系以及它所运用的推理模式。对于模式识别任务,这种缺失尚可容忍。但对于智能体AI(系统基于自身结论采取行动),这往往是将有潜力的概念验证转化为组织可依赖的运营解决方案的关键一步。

本文引入"知识卡",这是一种结构化制品,以专家可审阅、组织可审计、AI系统可推理的形式,捕捉关于单个有界概念的已验证知识。针对一个概念(如特定故障模式、合规义务或流程决策),知识卡记录涉及的实体与关系、连接它们的推理、该推理不再成立的条件,以及每项主张的来源,所有内容均基于形式化的领域本体论,并由领域专家签署确认。它由五个属性定义:基于本体、来源可溯、边界显式、专家验证、可版本化。本文阐述其架构,通过能源行业智能体AI案例进行说明,并讨论该结构支持的三个应用场景:智能体记忆、工业诊断和法规合规。已在能源和制药领域构建了初始原型卡片。该模式已作为公开草案发布以促进社区交流。

关键词:知识表示、本体论、智能体AI、语义层、AI透明度、专家验证知识、智能体记忆

## 引言

AI系统的文档化已沿多个维度成熟。模型卡(Mitchell等,2019)描述行为属性:系统做什么、在不同群体中的表现、已知的局限性。数据卡(Pushkarna等,2022)描述输入属性:来源、收集方法、偏差。系统卡则将其扩展到整个已部署系统的风险。这些制品已成为研究领域的标准实践,并在工业界日益普及。

有一个层面尚未被文档化:系统进行推理所依据的知识、它持有的概念、它建模的关系、它运用的推理模式,以及超出其适用范围的限制。对于模式识别系统,这种遗漏是可以接受的。然而,对于智能体AI——系统不仅进行分类或检索,还基于其结论采取行动——这个知识层变得至关重要:派遣维修团队、批准变更、调整控制参数。在此,部署智能体的公司必须能够审视并支持其推理所依据的知识。这正是许多AI项目停滞不前的层面。事实上,某个概念验证可能在演示中表现良好,却无法投入生产,因为系统所依赖的知识无法被检查、验证或治理。最近,行业分析师描述的这种语义层,已成为企业AI的基础性需求而非优化项(Gartner,2026)。

考虑一个帮助风电场运营商应对齿轮箱振动警报的智能体。该智能体必须判断信号是表明真实的轴承退化(需要昂贵的维修调度),还是可安全观察的暂时波动。要负责任地做出此判断,它需要的不仅仅是检索到的手册:它需要知道哪些信号是决定性的、它们之间如何存在因果关系,以及在什么条件下其自身的诊断不适用。

近期的一些方法旨在丰富AI系统在运行时可调用的内容。检索增强生成(RAG)获取相关文本并让模型解释。图增强检索(Edge等,2024)将语料库组织成知识图谱;DeepWiki(Cognition Labs,2025)等文档格式将材料组织为智能体可浏览的链接页面。这些方法回答了重要问题:存在哪些相关材料,以及如何高效地呈现它们。但呈现材料不等于提供知识。此处有必要区分数据(原始记录和信号)、信息(置于上下文中的数据)和知识(经过验证、与其他已知信息关联、并适合用于推理和行动的信息)。检索和图增强检索处理的是数据和信息:它们使正确内容更易找到。但一个不同的问题依然存在:智能体所需的知识——经过验证的、有界的、可检查且可支持的知识——是否实际可用?检索使内容更易找到,但其本身并不能使内容具有权威性。

本文引入"知识卡",这是一种结构化制品,以专家可审阅、组织可审计、AI系统可推理的形式,捕捉关于单个有界概念的已验证知识。对于给定概念,知识卡记录涉及的实体与关系、连接它们的推理、该推理不再成立的条件,以及每项主张的来源。所有这些都基于形式化的领域本体论,因此每个术语都具有固定含义,并在卡片被视为权威之前由领域专家签署确认。五个属性(第3节将进一步介绍)使其明确化:基于本体、来源可溯、边界显式、专家验证、可版本化。

知识卡由领域专家参与编写。虽然通常由自动化流程起草,但知识卡旨在由专家修正和批准,之后供机器消费。基于LLM的智能体可以直接阅读知识卡并用自然语言进行推理;由于每个术语都映射到形式化本体论,同一卡片也可由符号推理器验证。因此,知识卡补充了LLM的使用:它为智能体提供可推理的已验证知识,并为组织提供一种验证推理是否保持在已知范围内的方法。

本文的贡献包括:

- • 引入知识卡作为验证知识的结构化制品,由五个属性定义:基于本体、来源可溯、边界显式、专家验证、可版本化。
- • 架构基于领域本体论(一个领域共享的形式化词汇表)与实例化它的单个卡片之间的分离。
- • 同一结构适用于任何有界的推理任务:故障模式、合规检查、流程决策。知识卡不局限于某个领域或某类知识;它是单个有范围、经过验证的推理单元的通用容器。这种通用性使得卡片库能够成为组织AI系统的语义层,而非一次性的制品。
- • 讨论了三个应用场景:智能体记忆、工业诊断和法规合规。在这些场景中,知识卡满足了现有制品未能满足的需求。
- •

论文其余部分组织如下。第2节回顾相关工作:AI文档制品、检索与图方法,以及与知识卡最接近的当代格式。第3节描述知识卡及其五个定义属性,并以能源行业的实例作为指引。第4节阐述模式与推理层。第5节讨论该结构支持的三个应用场景,第6节进行总结。

## 相关工作

本节将知识卡置于三类工作的背景中进行定位。首先是AI文档制品(如模型卡、数据卡和系统卡),它们开启了结构化文档实践,但未触及知识层。其次是检索与图方法,它们改善了相关材料在运行时到达模型的方式。第三是与知识卡精神最接近的当代格式,它们从不同方向汇聚于同一缺口。

### AI文档制品

模型卡(Mitchell等,2019)旨在明确模型预期用途、不同群体的表现和已知局限性,以便系统能够被负责任地评估和采用。数据卡(Pushkarna等,2022)对数据集做了同样的事情,记录其来源和收集方法。IBM AI事实表(Hind等,2019)和系统卡将这种实践扩展到可信度和部署风险。它们共同确立了一个重要原则:AI系统应附带关于其构建方式和行为方式的结构化文档。

这些制品描述的是系统及其数据。而系统进行推理所依据的知识——应用于特定案例的具体概念、因果关系和推理模式——处于不同的层次,现有的制品类别都未能捕捉它。模型卡可能在文本中注意到系统作为整体的局限性;但它没有以机器可读、形式化基础的形式,表示系统对特定概念执行的推理。欧盟AI法案(European Parliament and Council,2024)和FDA AI/ML框架(U.S. Food and Drug Administration,2021)的透明度义务恰恰触及这一层面,具体到系统推理的概念基础和限制,这就是为什么这一差距在实践中至关重要。

### 检索、图增强检索与上下文图

大量工作致力于改善相关数据和信息在运行时到达模型的方式。GraphRAG(Edge等,2024)从文档语料库构建知识图谱,并报告在全面性和答案多样性方面相较于传统检索的提升,适用于广泛的意义建构查询。LlamaIndex Property Graph(LlamaIndex,2024)和Neo4j GraphRAG(Neo4j,2024)提供了相关的图构建和检索工具。这些系统组织语料库,使LLM能够更有效地找到和组合相关段落。它们的图是自动构建并用字符串标记的;节点或边的含义是提取模型推断出来的,可能并非固定于形式化本体论(Edge等,2024)。

有两个当代系统与知识卡更接近,值得直接比较,因为它们都触及了同一根本缺口:缺乏将已验证知识输入AI和智能体系统的共享标准。

TrustGraph上下文图(Davis,2025)扩展了知识图谱,加入了基于OWL的实体类型、源自文档的PROV-O溯源以及时间感知。开放知识格式(Open Knowledge Format,OKF)(McVeety and Hormati,2026)由Google Cloud发布,采用了相反的设计立场:知识是一个链接的markdown文件目录,带有YAML frontmatter,包含一个强制字段,内容模型则由生产者决定。表1总结了这些系统与检索系统相对于知识卡的关系。比较识别了智能体系统最需要从知识源获得的内容:一个形式化基础、支持推理与验证、声明其自身范围并携带明确专家验证记录的知识单元。

表1:相关方法在智能体系统所需知识源属性方面的比较。“形式化基础”指术语相对于本体论是固定的,而非由消费者解释;“支持推理”指符号推理器可以验证结论,而不仅仅是LLM;“范围已声明”指该制品声明了其适用范围的终止点。知识卡有助于创建一种共享结构,使得同一概念在所有消费它的系统中具有相同的含义。

## 知识卡

知识卡捕捉关于一个有界概念的已验证知识。它是领域知识库中的一个命名个体:它从形式化领域本体论中提取其词汇。本体论表示对故障模式、流程参数以及一个对另一个产生影响等概念的共享定义。知识卡为某个特定概念实例化该词汇。由于词汇是形式化的,卡片上的每个主张都继承了本体论的推理机制:术语具有固定含义,关系具有声明的定义域和值域,结论可被检查一致性。这使知识卡区别于文档或自动提取的图谱——在后者中,标签的含义仅取决于读者或模型的解读。

概念C在系统S中的知识卡KC\(\mathit{KC}\)是以下元组:
\[\mathit{KC}(C,S) = \langle \mathcal{M}, \mathcal{C}, \mathcal{E}, \mathcal{R}, \mathcal{P}, \mathcal{B}, \mathcal{L} \rangle\] (1)
其中\(\mathcal{M}\)是元数据(来源、生命周期、验证记录),\(\mathcal{C}\)是概念锚点(一个本体论类),\(\mathcal{E}\)是实体注册表(涉及的个体及其类型化角色),\(\mathcal{R}\)是关系拓扑(带有置信度的命名关系),\(\mathcal{P}\)是推理模式集,\(\mathcal{B}\)是边界条件集,\(\mathcal{L}\)是与消费系统的链接。

### 实例详解:风电场维护智能体

考虑引言中支持风电场运营商的智能体。一台风力涡轮机发出齿轮箱振动警报。智能体的任务是判断该警报是表明高速轴轴承的外圈剥落(一种需要派遣维修团队的退化模式),还是良性的暂态波动。此概念的知识卡为智能体提供了负责任推理所需的已验证结构。

故障模式`energy:GearboxBearing_OuterRaceSpalling`是卡片的概念锚点。其实体注册表列出了相关内容及其关系:高速轴轴承(主体)、轴承外圈(退化的部件)以及可观察信号,即轴承在特征频率处的振动幅度。

相似文章

关于知识表示

Lobsters Hottest

一篇探索人工智能中知识表示的文章,区分模型知识与状态知识,并讨论让计算机理解类似地址簿中那样细微上下文的挑战。

Kit For AI

Product Hunt

Kit For AI 是一个专为AI代理设计的记忆层,提供持久的上下文和知识存储。