以任务为中心的本体与确定性领域规则作为AI辅助化学问题求解的可验证核心
摘要
本文介绍了ChemOntoRule,一个概念验证的神经符号系统,它使用以任务为中心的本体和确定性规则来解决学校级别的化学问题,在受控评估中达到了高准确率。
arXiv:2608.26164v1 公告类型:新
摘要:大型语言模型可以解释自然语言化学问题,但其内部推理难以检查、约束和验证。本文介绍了ChemOntoRule,一个用于AI辅助学校级别化学问题求解的概念验证符号核心。核心设计选择是以任务为中心的本体工程:本体围绕一组定义好的化学问题所需的概念、属性、关系和可执行过程构建,而不是作为化学的通用表示。实现的工具结合了序列化为JSON和RDF/Turtle的轻量级本体,以及用于电子结构、周期性趋势、氧化态、氧化物和氢化物行为及相关学校级别推理模式的确定性Python规则。一个单独的专家编码回退机制处理尚未被通用规则覆盖的问题类型。该系统在300个人工编写并手动验证的化学问题上进行了测试。完整系统匹配了300个参考答案中的296个(98.67%)。以本体驱动的规则子集覆盖了269个问题并匹配了266个参考答案(98.88%);31个问题由任务特定的专家编码回退机制处理,匹配了30个。由于同一组问题用于本体构建和评估,这些结果衡量的是已实现的覆盖率和内部一致性,而非独立泛化能力。我们分析了四个不匹配之处,区分了结构验证与化学正确性,并定义了一个未来架构,其中语言模型主要充当从用户语言到标准化本体任务框架的翻译器。令牌效率被提出作为未来受控研究的可测试假设,而非当前工作的结果。
查看缓存全文
缓存时间: 2026/08/28 09:30
# 任务中心本体论与确定性领域规则:作为AI辅助化学问题求解的可验证核心
来源:https://arxiv.org/html/2608.26164
(2026年7月)
###### 摘要
大型语言模型可以解析自然语言形式的化学问题,但其内部推理过程难以进行检查、约束和验证。本文提出了ChemOntoRule,一个用于AI辅助学校级别化学问题求解的概念验证符号核心。其中心设计选择是任务中心的本体论工程:该本体论是围绕一组定义好的化学问题所需的概念、属性、关系和可执行过程来构建的,而非作为化学知识的通用表示。所实现的工件将采用JSON和RDF/Turtle序列化的轻量级本体论,与用于电子结构、周期性趋势、氧化态、氧化物和氢化物行为以及相关学校级别推理模式的确定性Python规则相结合。一个独立的专家编码回退机制用于处理尚未被通用规则覆盖的问题族。该系统在300道人工编写并经手动验证的化学问题上进行了检验。完整系统与296道参考答案匹配(98.67%)。本体论驱动的规则子集覆盖了269道问题,匹配了266个参考答案(98.88%);31道问题由针对特定任务的专家编码回退机制处理,其中30个匹配成功。由于同一问题集同时用于本体论构建和评估,这些结果衡量的是已实现的覆盖范围和内部一致性,而非独立的泛化能力。我们分析了四个不匹配的案例,区分了结构验证与化学正确性,并定义了未来架构,其中语言模型主要作为将用户语言转换为规范化本体论任务框架的转换器。令牌效率被提出作为未来对照研究的可检验假设,而非当前工作的结果。
关键词:任务中心本体论;神经符号AI;化学问题求解;确定性规则;知识表示;可解释AI;大型语言模型
## 1 引言
大型语言模型(LLMs)已展现出广泛的化学知识和在特定化学基准测试中的强大性能,但同时也表现出不一致性、过度自信,以及在一些看似基础的问题上失败的情况[1 (https://arxiv.org/html/2608.26164#bib.bib1), 3 (https://arxiv.org/html/2608.26164#bib.bib3), 2 (https://arxiv.org/html/2608.26164#bib.bib2), 5 (https://arxiv.org/html/2608.26164#bib.bib5)]。这些特性使得LLMs可作为有用的语言接口,但在中间步骤、规则适用性和最终答案必须可检查的场景中,作为领域推理的唯一来源则存在问题。
一种互补的方法是显式地表示相关领域知识,并在该表示上执行确定性过程。本体论提供机器可读的类、属性、个体和公理[12 (https://arxiv.org/html/2608.26164#bib.bib12), 13 (https://arxiv.org/html/2608.26164#bib.bib13)];外部规则引擎随后可以使用本体论关联的事实来进行计算或分类。例如,KnowTD将一个热力学本体论与一个推理器耦合,该推理器选择方程并产生可解释的解决方案[6 (https://arxiv.org/html/2608.26164#bib.bib6)]。更广泛地说,神经符号研究寻求结合神经模型的语言灵活性与符号系统的透明性和可控性[8 (https://arxiv.org/html/2608.26164#bib.bib8), 9 (https://arxiv.org/html/2608.26164#bib.bib9)]。
本文研究一个更窄且刻意实用的问题:一个任务中心本体论和一个确定性领域规则引擎能否构成未来AI辅助化学问题求解的可验证核心?预期的分工是不对称的。语言模型负责将用户的自由形式请求转换为受约束的任务表示,并在之后将结果表述出来;而化学推理本身则尽可能委托给显式的、与本体论关联的过程。图1 (https://arxiv.org/html/2608.26164#S1.F1)展示了这一预期架构,并标记了当前研究中评估的符号核心。
请参考图注图1:预期的AI辅助架构。虚线表示的AI翻译层在本文中提出但未进行评估。当前研究评估了符号核心内的本体论、确定性领域规则、参考答案匹配和结构验证。
本文的贡献并非声称该系统能普遍解决化学问题。相反,本文的贡献在于:
1. 一种任务中心的方法,用于从一组限定问题集的胜任力要求中推导本体论内容;
2. 一个本体论支持的外部规则引擎,适用于选定的学校级别化学问题族;
3. 通用本体论驱动规则与特定任务专家编码回退机制之间的透明分离;
4. 在300道人工编写并手动验证的问题上进行的概念验证评估,包括覆盖范围、参考答案匹配和错误分析;
5. 一个范围界定清晰的提议,即使用LLM作为到符号系统的自然语言转换器,将令牌效率保留为未来的实证问题。
## 2 相关工作
### 2.1 LLMs与化学问题求解
ChemLLMBench在八个化学任务上评估LLMs,显示模型性能因任务和提示条件的不同而有显著差异[3 (https://arxiv.org/html/2608.26164#bib.bib3)]。ChemBench提供了一个更大的框架,包含超过2700个化学问题-答案对,并报告了强大的平均性能和持续存在的基础错误及过度自信[1 (https://arxiv.org/html/2608.26164#bib.bib1)]。ChemLLM探索了针对化学领域的特定语言模型开发[4 (https://arxiv.org/html/2608.26164#bib.bib4)]。SciBench评估了数学、物理和科学问题解决,并强调了多步科学推理的难度[2 (https://arxiv.org/html/2608.26164#bib.bib2)]。QCBench专注于定量化学,并明确强调跨多个子领域和难度级别的逐步数值推理[5 (https://arxiv.org/html/2608.26164#bib.bib5)]。
这些工作激励了领域特定的评估,但本研究的目标不同。它主要不是基准测试一个LLM。相反,它评估的是一个确定性符号核心,该核心设计用于接收来自最终AI语言接口的结构化任务表示。
### 2.2 基于本体论和神经符号的推理
本体论形式化了概念及其关系,可以作为RDF图进行交换或用OWL表示[13 (https://arxiv.org/html/2608.26164#bib.bib13)]。像SHACL这样的验证语言提供了一种补充机制,用于根据显式约束检查RDF图[14 (https://arxiv.org/html/2608.26164#bib.bib14)]。在科学问题求解中,KnowTD展示了一个可操作的知识表示,其中本体论和推理器协同工作以选择热力学方程并解决入门问题[6 (https://arxiv.org/html/2608.26164#bib.bib6)]。关于LLMs和热力学问题求解的比较工作进一步说明了生成方法的灵活性和可变性[7 (https://arxiv.org/html/2608.26164#bib.bib7)]。
最近关于本体论指导语言模型推理的工作认为,当检索和基础准确时,显式的领域知识可以提高可靠性,而无关的上下文可能会降低性能[11 (https://arxiv.org/html/2608.26164#bib.bib11)]。神经符号调查同样强调可解释性、鲁棒性和显式推理是混合架构的动机[8 (https://arxiv.org/html/2608.26164#bib.bib8), 9 (https://arxiv.org/html/2608.26164#bib.bib9)]。
### 2.3 任务中心的本体论构建
本体论工程通常使用能力问题来陈述本体论必须能够回答什么。最近的工作研究了LLM对生成此类问题的支持,同时保留了领域要求和专家评估的核心作用[10 (https://arxiv.org/html/2608.26164#bib.bib10)]。当前系统遵循一个务实的能力驱动过程:检查问题族;识别所需的实体、属性和规则;并且只实现目标任务空间所需的知识。这产生了一个比综合化学本体论更窄的工件,但它可以直接为一组定义的问题模式执行。
## 3 研究范围与问题
本研究解决四个问题:
RQ1(覆盖范围):在300道问题集中,有多大比例可以路由到通用的本体论驱动规则,而不是特定任务的回退机制?
RQ2(参考答案匹配):完整系统、本体论规则子集和回退子集与人工验证的参考答案匹配的频率如何?
RQ3(失败模式):哪些建模或实现假设可以解释观察到的不匹配?
RQ4(AI集成):未来的基于LLM的转换器应该暴露什么样的接口,以便自然语言请求可以通过确定性符号核心得到解决?
本文*不*声称分布外泛化能力、优于受控的LLM基线、降低的推理成本或经过测量的令牌节省。
## 4 问题集与验证
评估集包含300道人工编写的学校级别化学问题,附带参考答案和解题过程。该问题集经过手动审查和验证,用于本研究。完整的任务陈述不予重新分发,因为它们可能受到第三方许可限制。因此,发布的稿件包报告了汇总统计、系统设计和不匹配描述,但不复制完整的问题文本。
该问题集有两个用途:它为任务中心的本体论提供了需求,并提供了概念验证评估集。这种双重用途是结果解释的核心。报告的数字描述了在设计的任务空间内已实现的覆盖范围和内部一致性;它们并未估计在独立未见分布上的性能。
表1 (https://arxiv.org/html/2608.26164#S4.T1)显示该问题集以选择序列题为主。这种不平衡限制了对开放式推导和数值问题求解的结论。
表1:300道问题集中的答案类型分布。
平均问题长度为217.7个字符,解题记录平均包含2.24个关联概念。七个操作性任务族如图2 (https://arxiv.org/html/2608.26164#S4.F2)所示。这些是实现中使用的路由类别,在报告的指标中是互斥的。
请参考图注图2:300道问题在实现层任务族中的分布。
## 5 任务中心本体论
### 5.1 设计原则
传统的领域本体论可能旨在广泛表示化学。而本本体论则从一个限定的任务空间开始。对于每个反复出现的问题族,开发过程识别:
1. 问题中显式存在的实体和值;
2. 目标关系、分类或排序;
3. 达到目标所需的化学性质;
4. 规则适用的条件;
5. 输出格式和可用的结构检查。
这个过程可以被解释为一组能力问题。例如:哪些元素具有指定的外层电子数?一个给定的氧化物公式代表哪些氧化态?哪些选定的元素应按特定的周期性趋势排序?哪种离子-电子变换能产生稳定的电子壳层构型?
### 5.2 形式化视角
令本体论为
O=(C,P,I,A),\mathcal{O}=(\mathcal{C},\mathcal{P},\mathcal{I},\mathcal{A}), (1)
其中 \mathcal{C} 是类的集合,\mathcal{P} 是属性和关系的集合,\mathcal{I} 是个体的集合,\mathcal{A} 是断言或推导出的属性值的集合。一个可执行的领域规则抽象表示为
r_j: \phi_j(z, \mathcal{O}) \rightarrow (y_j, \tau_j), (2)
其中 z 是规范化的任务框架,\phi_j 是适用性谓词,y_j 是结果,\tau_j 是追踪或解释片段。
对于用户查询 q,预期的AI转换器 T_\theta 最终将产生
z = T_\theta(q) = (f, E, K, o), (3)
其中 f 表示任务族,E 是识别的实体,K 是约束或请求的属性,o 是输出模式。然后确定性核心计算
S(z, \mathcal{O}, \mathcal{R}) \rightarrow (a, \tau, v), (4)
其中 a 是答案,\tau 是追踪,v 是验证状态。当前研究使用对提供的任务格式进行受约束的确定性解析来评估 S;它不评估 T_\theta。
### 5.3 已实现的本体论内容
工作本体论包含四个声明的概念类:Element, PeriodicTrend, OxidationStateRule 和 ManualReactionPattern。八个与任务相关的关系组将元素连接到周期、族、区、外层结构、氧化态、氧化物形成、挥发性氢化物形成和趋势分数。实例层包含52个化学元素,具有存储和推导的属性。RDF/Turtle序列化包含约1029个三元组,包括17个数据类型属性。
该本体论是有意设计的轻量级。大多数可执行逻辑保留在外部Python规则引擎中,而非OWL公理、SWRL规则或SHACL函数中。因此,该实现最好描述为*本体论支持的外部规则引擎*,而非纯粹的OWL推理器。
请参考图注图3:当前实现中的知识层。通用符号过程和特定任务的专家回退机制被显式分离。
## 6 确定性领域规则引擎
规则引擎用Python实现,并使用显式过程推导或评估学校级别的化学属性。主要组包括:
- 电子结构构建和亚层计数;
- 外层和价电子计算;
- 未成对电子计算;
- 稳定离子的电子计数;
- 氧化态的最高值、最低值及范围;
- 常见氧化物化学式模式的可行性检查;
- 金属、非金属、酸性、碱性和氢化物趋势的启发式分数;
- 识别的任务模板的路由和排序规则。
每个解决的记录包含最终答案、关联概念、简短的解题追踪和方法标签。方法标签为 `ontology_rule` 或 `manual_expert`。前者表示链接到本体论的可重用确定性过程。后者表示当通用规则库未覆盖问题族时使用的特定任务专家编码解决方案。
这种区分防止了回退答案被错误地表示为本体论推理。它也暴露了一条具体的扩展路径:一个回退问题族只有在其实体、适用条件、转换和验证规则独立于任务标识符被表示之后,才能变为通用。
## 7 处理与验证
测量工具将每个解决方案表示为六个逻辑阶段:
1. 任务接收;
2. 条件解析;
3. 求解器路由;
4. 本体论上下文查找;
5. 答案生成;
6. 结果验证。
在300个任务中,...相似文章
多智能体生成可验证规则用于确定性、自扩展的反应分类
本文提出了一种多智能体大语言模型流水线,能够自动生成并验证化学反应规则,将标准分类从68类扩展至14,073类,无需人工策展,在未见反应上达到97.7%的分类准确率。
连接化学家与人工智能:一种专家增强的可解释路线评估框架
本文介绍了一种专家增强的数据驱动评分框架,该框架将机器学习与化学家的领域知识相结合,用于评估多步合成路线,在预测准确性上相较于基线方法取得了显著提升。
本体知识块:可执行合规性与基于配置文件的验证用于可信AI系统
本文介绍了本体知识块(OKBs),这是一种可编程治理基础设施,将监管义务编译为机器可检查的约束条件,用于可信AI系统,并在HPC资源分配中进行了原型评估。
面向企业AI智能体的部署前保障:基于本体论的仿真与信任认证
研究人员提出了一种基于本体论的企业AI智能体部署前验证框架,结合了智能体操作包络、自动化场景生成以及可机器验证的信任证书与分级部署判定。在四个受监管行业开展的试点研究共生成1,800个测试场景,结果显示基于本体论的生成方法在监管覆盖率上显著优于基于角色的基线方法。
构建理解化学原理的AI模型
MIT副教授Connor Coley讨论他开发AI模型以理解化学原理并通过预测反应路径和分析海量潜在化合物来加速药物发现的工作。