我们能否基于原子命题使用图来实现可解释的NLI?

arXiv cs.AI 论文

摘要

本文探索使用基于原子命题的图表示来实现可解释的自然语言推理(NLI),提出一个流水线,在SNLI数据集上达到89.7%的准确率,以性能换取可解释性。

arXiv:2609.16814v1 Announce Type: new 摘要:尽管基于大型语言模型(LLM)的自然语言推理(NLI)系统达到了高精度,但其决策过程缺乏可审计的结构。本文探讨是否可以使用仅基于证据的可解释图表示来执行NLI。我们引入了一个完全基于图的流水线,其中分类器从不直接处理输入文本。相反,句子被分解为原子命题,通过受约束的解码转换为ConceptNet三元组,并表示为每对的三个图:前提、假设和检索到的ConceptNet子图。然后将这些图输入到一个微调过的0.8亿参数语言模型中。在SNLI数据集上,我们的流水线达到了89.7%的准确率,仅比同样训练的基于文本的模型低1.9个百分点。在ANLI上,它匹配了RoBERTa-large在轮次R2和R3上发表的性能(50%准确率),但在R1上落后16个百分点,导致与文本对应物相比整体差距为9到14个百分点。我们将这一差距称为可解释性的代价,并证明它源于表示限制而非数据限制。消融研究进一步揭示,图和文本是互补的:结合两种模态在SNLI上达到了92.1%的准确率。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:04

# 基于原子命题的图结构能否实现可解释的自然语言推理?
来源:https://arxiv.org/html/2609.16814
作者:Luc Pommeret、Thomas Gerald、Patrick Paroubek、Sophie Rosset
所属机构:Université Paris-Saclay, CNRS, Laboratoire Interdisciplinaire des Sciences du Numérique, 91400, Orsay, France
通讯邮箱:[[email protected]](mailto:[email protected])

###### 摘要

尽管基于大语言模型(LLM)的自然语言推理(NLI)系统能实现高准确率,但其决策过程缺乏可审计的结构。本文探索了是否仅通过可解释的、基于图的证据表示来执行NLI。我们引入了一个完全基于图的处理流程,分类器从不直接处理输入文本。句子首先被分解为原子命题,通过受控解码转换为ConceptNet三元组,并表示为三组图:前提图、假设图和一个检索到的ConceptNet子图。这些图随后被输入到一个微调过的0.8B参数语言模型中。在SNLI数据集上,我们的流程达到了89.7%的准确率,仅比同等训练的基于文本的模型低1.9个百分点。在ANLI上,其在R2和R3轮次的表现与已发表的RoBERTa-large性能持平(50%准确率),但在R1上落后16个百分点,导致与文本对应模型的整体差距在9到14个百分点之间。我们将这一差距称为*可解释性代价*,并证明这源于表示能力的限制而非数据约束。消融实验进一步揭示图与文本是互补的:结合两种模态在SNLI上达到了92.1%的准确率。

## 1 引言

自然语言推理(NLI)是自然语言理解(NLU)的一项基础任务。NLI中的准确预测需要多层次的推理,涵盖词汇(例如同义词、反义词)、句法(例如否定、量词)和语义(例如逻辑蕴含、常识知识)维度。尽管当前系统在SNLI(Bowman et al., 2015)和MultiNLI(Williams et al., 2018)等基准测试上取得了最先进的性能,但这些数据集并非没有缺陷。例如,Gururangan等人(2018)指出,标注偏差、否定和模糊性与特定类别高度相关,使得即使是浅层模型也能表现出惊人效果:一个仅基于假设训练的简单文本分类器在SNLI上能达到67%的准确率,在MultiNLI上达到53%。这表明这些基准上的高性能很大程度上可能源于利用语言假象而非真正的推理能力。

(图1说明:流程的四个阶段。配对中的两个句子被分解为原子命题,每个命题在约束的JSON schema下被转换为ConceptNet三元组,形成前提图\(P\)和假设图\(H\),第三个图\(K\)从ConceptNet检索,三个图按\(K, P, H\)顺序序列化后输入分类器。没有自然语言文本到达分类阶段。)

为了应对这些假象,ANLI(Nie et al., 2020)被引入作为一个更稳健的基准。通过迭代式人在回路的协议构建,ANLI包含三个难度递增的轮次(R1、R2和R3)。在每个轮次中,标注员负责在给定前提的情况下,构建出当前最先进模型会误分类的假设。然后由其他标注员验证这些样本的有效性。每一轮后,对抗性样本被纳入训练数据,并对模型进行再训练。

鉴于这种设计,ANLI为评估我们基于知识图谱方法的有效性提供了一个自然的测试平台。通过评估在ANLI上的性能,我们可以确定我们的系统是利用结构化知识实现了真正的推理,还是同样依赖了表面模式。

在这种背景下,通常会使用同一指标(准确率)的两个连续测量值。第一个测量值是通过将原始文本输入大型预训练模型获得的,其中没有明确的推理线索。然而,可解释性是通过将决策过程约束在依赖可解释的中间结构(例如知识图谱)上来实现的。

在本工作中,我们量化了*可解释性代价*,即这两种方法之间的性能差距。

我们的核心研究问题是:*图是否足够?* 换句话说,仅靠结构化表示能否达到有竞争力的性能,还是在可解释性和准确性之间存在固有的权衡?我们的目标是系统地衡量和分析这种权衡。

##### 我们的贡献。

在这里,我们提供了一个完全在知识图谱上执行NLI任务的流程,采用ConceptNet(Speer et al., 2017)的语法。图从原子命题中提取,如Pommeret等人(2026)所述,并通过检索到的ConceptNet子图进行增强,序列化后由微调过的Qwen3.5-0.8B-Base进行分类。该设计确保没有原始文本到达分类器,因此用于决策的每一条信息都存在于一个可解释的三元组列表中。代码地址:https://anonymous.4open.science/r/graph-nli-anon-1F68/
我们的贡献如下:

1.  一个完整的基于图的NLI流程,包含从ConceptNet派生的28种关系提取词汇表,以及确保结构一致性的约束JSON schema(见第4.1.2节)。
2.  量化*可解释性代价*:我们在同等条件下测量了基于文本的模型与基于图的模型之间的准确率下降:在SNLI上为−1.9个百分点,在ANLI上为−9至−14个百分点(见表3)。
3.  表示能力而非数据是瓶颈:性能差距源于结构限制而非数据稀缺。从MNLI和FEVER-NLI添加60万训练对,在ANLI上仅带来+0.6个百分点的提升(见第6.4节)。
4.  消融研究以隔离关键因素:(i) 来自ConceptNet的外部知识的贡献,以及(ii) 图模型与文本模型的结合(见第6.3节)。

## 2 相关工作

利用外部知识进行自然语言理解(NLU)任务是一种成熟的方法。在问答(QA)中,QA-GNN(Yasunaga et al., 2021)和KagNet(Lin et al., 2019)等系统通过集成ConceptNet作为外部知识库,弥合了问题与候选答案之间的语义鸿沟。对于自然语言推理(NLI),KIM(Chen et al., 2018)通过纳入基于WordNet的关系(如同义、反义、上位、下位)来增强词汇理解。类似地,KGNLI(Wang et al., 2020)从前提和假设中提取关键概念,构建连接两者的知识子图。

虽然将前提和假设分解为原子命题提高了可解释性并能够诊断逻辑缺陷,但这种方法本身并不能固有地提高准确率,除非对模型进行微调(Srikanth and Rudinger, 2025; Huang, 2026)。第3节描述的流程通过将原子命题作为三元组提取阶段的输入来解决此限制。

最后,我们的分类器将图作为序列化的文本进行处理。将结构化输入序列化后输入语言模型,而非使用专用的图网络进行编码,现在是一种常见的选择(Fatemi et al., 2024),我们遵循了这一做法:它利用了关系名称的预训练语义,并确保每个三元组对于模型的注意力机制都保持独立可访问。虽然这种方法具有明显优势,但与图编码器的系统比较仍是未来研究的途径。

## 3 提出的方法

原子事实首先从前提和假设中提取出来,然后转换为(主体, 关系, 客体)三元组。这种分解通过简化分配给提取器的任务来改进三元组提取(Pommeret et al., 2026):它一次处理一个最小语义单元,而不是一次性从复杂句子中分离多个事实,从而减少了每次调用需要提取的事实数量,并确保源句子中的每个原子事实都不会被遗漏。

该流程将一个(前提, 假设)对映射到集合{蕴含, 中立, 矛盾}中的一个标签,通过四个阶段实现,使得该对中没有原始文本参与最终决策(见图1)。

1.  **原子化**。使用MPropositionneur-V2-large模型将配对中的两个句子分解为原子命题,该模型经过蒸馏,用于带有指代消解的多语言原子化(Pommeret et al., 2026)。
2.  **三元组提取**。每个原子命题在约束的JSON schema下,由Qwen3.5-9B模型转换为一组(主体, 关系, 客体)三元组,其关系字段是28种ConceptNet关系的枚举。其命题的所有三元组的并集构成了前提的图\(P\)和假设的图\(H\)。
3.  **知识增强**。从ConceptNet基础数据库的330万条边中检索第三个图\(K\):连接在\(P\)中但不在\(H\)中出现的实体与在\(H\)中但不在\(P\)中出现的实体的桥接边(1跳和2跳),以及每个实体的1跳邻域。
4.  **分类**。三个图按\(K, P, H\)顺序序列化为一个字符串,输入到Qwen3.5-0.8B-Base模型,该模型在不同NLI基准的训练集上进行了微调。

##### 为何我们不将原始文本输入给LLM。

一个同时读取文本和图的模型,只会在文本不足的地方使用图。因此,对其图使用的任何解释都是*事后*的。通过移除文本,我们使中间结构具有决定性,这意味着*图中的错误就是预测中的错误*。反之,每个预测都可以追溯到一个有限的三元组列表。可解释性选择的成本呈现在表3中。

## 4 实验协议

本节按照流程应用的顺序进行说明。第4.1节涵盖图的构建,首先是将句子原子化为命题(第4.1.1节),然后是从每个命题中提取三元组(第4.1.2节);第4.2节描述了外部子图\(K\)的检索;第4.3节描述了三个图的序列化以及分类器的微调。每个阶段都约束了下一个:命题限定了提取器能看到的内容,而提取出的实体限定了可以从ConceptNet检索的内容。

### 4.1 图构建

#### 4.1.1 Propositionneur(命题提取器)

句子由MPropositionneur-V2-large进行原子化,这是对Qwen3的微调,从更大的教师模型在六种欧洲语言的维基百科语料上蒸馏而来(Pommeret et al., 2026)。通过提示"Atomize: {sentence}"进行调用,并在vLLM(Kwon et al., 2023)下将其输出约束为字符串的JSON数组。解码为贪心策略(温度\(T=0\))。

ANLI中来自ANLI的长对抗性前提,有7%的句子导致命题提取器退化为重复循环。因此我们应用了一个清洗步骤:不区分大小写和空格的去重,移除任何长度超过源句子长度1.6倍加二十个字符的命题,并将每个句子的命题数上限设为16个,如果过滤器清空列表则回退到源句子。SNLI和ANLI(R1, R2和R3)都已进行原子化处理。

#### 4.1.2 信息提取

##### 提取。

提取使用由vLLM服务的Qwen3.5-9B,并采用少样本提示:提示中提供关系列表及其描述、一组编码规则和九个标注示例(见附录A)。重要的是,解码受JSON schema约束,其中关系字段是28种关系的`enum`枚举,因此设计上不可能出现词汇表外的关系。该schema还将输出限制为最多8个三元组:提示要求至少两个,而schema强制至少一个。

##### 关系词汇表。

提取词汇表包含28种关系,全部是ConceptNet关系(Speer et al., 2017)。仅使用ConceptNet关系名称有好处:提取的图可以直接与第3阶段使用的基础数据库对齐,并且关系名称带有预训练语义,分类器(微调过的LLM)可以加以利用。

##### 提示规则。

提取产生的图在局部看似合理,但在全局上存在问题,因为相同的事实以不同方式编码在\(P\)和\(H\)中,且两个图未能对齐。因此,提示设定了一个规范形式,并通过以下规则强制执行:

1.  **节点是词元**。节点是英语词元(小写),已被还原为其主题词:修饰语从不与其主题词一起出现(例如,`old_man`是禁止的,需要`man`加上`[man, HasProperty, old]`),动词从不与其宾语一起出现。多词节点专用于专有名词和词汇复合词。非相交形容词(例如`former_senator`,`fake_gun`)是例外(在提示中明确说明),因为拆分它们会改变真值条件。
2.  **论元结构固定**。动词的施动者总是采用`CapableOf`,受动者总是采用`ReceivesAction`;两者均来自及物动词。被动语态和主动语态变体被归一化为单一形式,使得`the book was written`和`someone wrote the book`产生相同的三元组。
3.  **附加语有类型**。受益者和接收者使用`HasContext`,目的地使用`MotivatedByGoal`,位置使用`AtLocation`,工具使用`UsedFor`,时间表达式使用`HasContext`。
4.  **基数是一个对象**。例如,`two men`表达为`[man, HasProperty, two]`,但裸复数不表示数字。
5.  **否定是一个关系**。否定的事实使用`Not*`关系,并将整个动词短语作为尾部。这使得矛盾在图中可见。
6.  **创作作品有固定方向**。创作的作品始终是`CreatedBy`的主体。

命题源中的每个内容词都必须(至少)产生一个三元组。解码后,节点被归一化...

相似文章

GraphInfer-Bench:在图上的LLM推理能力基准测试

arXiv cs.LG

介绍了GraphInfer-Bench,这是一个基准测试,用于评估LLMs是否能够进行图推理——生成关于节点及其邻域的开放式答案,这些答案无法从单个节点或路径中检索到。实验表明,即使是最前沿的LLMs在这些任务上也落后于普通GNNs,揭示了一个能力差距。

超越语义等价:用于LLM不确定性量化的逻辑图

arXiv cs.AI

本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。