面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理

arXiv cs.AI 论文

摘要

本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。

arXiv:2608.07873v1 公告类型:新 摘要:大语言模型(LLMs)越来越多地支持基于用户提供的、涵盖异构结构的知识进行响应生成。然而,现有基准对LLMs能否在这些知识上下文中忠实地执行多跳推理链,同时保持对输入顺序变化的鲁棒性,评估有限。我们引入了TKFQA,这是一个事实一致性基准,包含10,130个基于表格、文本和知识图谱(KGs)的问答(QA)对。每个示例都由一条明确的反事实推理链构建,从而能够联合评估答案正确性、推理链准确性以及对不同输入顺序的鲁棒性。对14个开源和闭源LLMs的广泛评估表明,最先进的模型在推理链准确性方面表现有限,并且对异构知识上下文输入顺序的变化仍然敏感。为了解决这些局限性,我们提出了ORLF,这是一个与LLM无关的训练框架,通过知识特定的潜在向量来建模跨上下文拓扑关系。ORLF集成了逐上下文位置编码、潜在桥接注意力掩码和拓扑知识偏置,以保留知识特定偏置并编码拓扑语义。在四个LLM主干网络上的实验表明,ORLF优于具有竞争力的免训练基线和基于LoRA的基线,平均精确匹配(Exact Match)和推理链准确率(Reasoning-Chain Accuracy)分别提高了2.15%和4.29%,同时将顺序引起的性能标准差降低了0.04%至3.01%。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:03

# 反事实基准与训练:异构知识上的大语言模型事实一致性保持与顺序鲁棒接地推理

Source: https://arxiv.org/html/2608.07838  
Shibo Chu1, Yuze Liu2, Tiehua Zhang1†, Zhishu Shen3, Lianghua He1, Haofen Wang1, Zhijun Ding1  
1同济大学,上海,中国  
2斯威本科技大学,墨尔本,澳大利亚  
3武汉理工大学,武汉,中国

†通讯作者。

###### 摘要

大语言模型(LLMs)已越来越多地支持基于用户提供的、跨越异构结构的知识来生成响应。然而,现有基准对 LLM 是否能在这些知识上下文中忠实地执行多跳推理链、同时保持对输入顺序变化的鲁棒性,评估十分有限。我们提出 TKFQA,一个事实一致性基准,包含 10,130 个基于表格、文本和知识图谱(KGs)的问答(QA)对。每个示例都由一条显式的反事实推理链构建,从而能够联合评估答案正确性、推理链准确率以及对不同输入顺序的鲁棒性。对 14 个开源和闭源 LLM 的广泛评估表明,最先进的模型表现出有限的推理链准确率,并且对异构知识上下文输入顺序的变化仍然敏感。为解决这些局限,我们提出 ORLF,一个与 LLM 无关的训练框架,通过知识特定潜在向量对跨上下文拓扑关系进行建模。ORLF 整合了上下文级位置编码、潜在桥接注意力掩码和拓扑知识偏置,以保留知识特定偏置并编码拓扑语义。在四个 LLM 主干上的实验表明,ORLF 优于竞争性的免训练和基于 LoRA 的基线,平均精确匹配(Exact Match)和推理链准确率分别提升 2.15% 和 4.29%,同时将顺序引起的性能标准差降低了 0.04% 至 3.01%。

## 1 引言

大语言模型(LLMs)在多个领域取得了显著进展,包括医疗诊断[Zhang 等 (2026)](https://arxiv.org/html/2608.07838#bib.bib59)、金融风险控制[Chen 等 (2026)](https://arxiv.org/html/2608.07838#bib.bib58)和软件开发[Liang 等 (2022)](https://arxiv.org/html/2608.07838#bib.bib57)。一种被广泛采用的用法是让 LLM 以外部知识上下文为条件,生成基于所提供信息的响应[Zhao 等 (2026)](https://arxiv.org/html/2608.07838#bib.bib61)。然而,随着 LLM 被部署在日益复杂的任务场景中,在用户提供的知识上下文上进行有效的接地推理仍然是一个基本挑战[Jacovi 等 (2025)](https://arxiv.org/html/2608.07838#bib.bib9);[Liu 等 (2025a)](https://arxiv.org/html/2608.07838#bib.bib60), [2026b](https://arxiv.org/html/2608.07838#bib.bib39)。大量数据集已被提出,从不同角度评估 LLM 的接地推理能力,包括多跳推理[Yang 等 (2018)](https://arxiv.org/html/2608.07838#bib.bib30);[Wu 等 (2025)](https://arxiv.org/html/2608.07838#bib.bib17)以及跨多种结构化知识上下文的推理[Chen 等 (2020)](https://arxiv.org/html/2608.07838#bib.bib18);[Lei 等 (2023)](https://arxiv.org/html/2608.07838#bib.bib62)。然而,现有基准在很大程度上忽视了 LLM 推理过程中的事实一致性[Jacovi 等 (2025)](https://arxiv.org/html/2608.07838#bib.bib9),即生成的响应是否忠实地基于用户提供的知识上下文。

为弥补这一空白,我们提出一个用于多跳接地推理的事实性评估基准,即 TKFQA,它包含 10,130 个与异构知识上下文(包括表格、文本和知识图谱(KGs))相关联的问答(QA)对。在具有不同结构的各类知识上下文中,精心构造的反事实链提供了推导正确最终答案的参考多跳推理序列。该链中的反事实实体使得我们能够评估 LLM 是否忠实地基于输入提供的知识进行推理,而不是仅仅依赖其内部参数化知识[Afzal 等 (2025)](https://arxiv.org/html/2608.07838#bib.bib63)。解决 TKFQA 中的问题要求 LLM 在异构知识上下文上进行接地推理,捕获不同知识上下文对之间的关系,并执行多跳推理以得出最终答案。此外,在推理过程中,异构知识上下文输入顺序的变化可能导致模型性能波动[Guan 等 (2025)](https://arxiv.org/html/2608.07838#bib.bib64)。

为解决这些问题,我们进一步提出 ORLF,一个与 LLM 无关的训练框架,通过知识特定潜在向量捕获异构知识上下文之间的拓扑关系,从而在多跳接地推理中保持事实一致性并减轻对输入顺序变化的敏感性。该框架包含三个关键组件:上下文级位置编码(CPE),在每个知识上下文内自适应位置编码;潜在桥接注意力掩码(LBAM),使潜在向量能够跨不同知识上下文进行注意力交互;以及拓扑知识偏置(TKB),自适应地编码拓扑语义。

总之,主要贡献概括如下:

- 我们提出 TKFQA,一个用于多跳接地推理的事实一致性评估基准,包含 10,130 个基于表格、文本和知识图谱的 QA 对。每个 QA 对都由一条显式的反事实推理链构建,从而能够评估答案正确性、推理链准确率以及对知识上下文输入顺序变化的鲁棒性。
- 我们提出 ORLF,一个与 LLM 无关的训练框架,通过知识特定潜在向量捕获异构知识上下文之间的拓扑关系。它整合了上下文级位置编码(CPE)、潜在桥接注意力掩码(LBAM)和拓扑知识偏置(TKB),以保持事实一致性并降低对输入顺序变化的敏感性。
- 我们在 TKFQA 上对 14 个最先进的开源和闭源 LLM 进行了全面的推理实验。结果表明,这些模型在理解异构知识上下文和执行鲁棒的多跳接地推理方面仍然能力有限。进一步的实验表明,所提出的 ORLF 在不同 LLM 主干上持续提升了答案准确率和推理链准确率,同时显著增强了对输入顺序变化的鲁棒性。
- 我们已在 https://github.com/xq7m4k9/a8v3n2 公开发布原始基准数据和源代码,以促进可复现性和该领域的进一步研究。

## 2 相关工作

##### 接地推理中的事实性评估。

现有用于评估事实性的基准主要关注单一知识结构内的接地推理,并未明确评估 LLM 推理过程中生成的推理链的正确性。[RAGTruth](https://arxiv.org/html/2608.07838#bib.bib8) 和 [FACTS](https://arxiv.org/html/2608.07838#bib.bib9) 评估生成的响应是否由检索到的或提供的文档支持,而 [HaluEval](https://arxiv.org/html/2608.07838#bib.bib10) 和 [FActScore](https://arxiv.org/html/2608.07838#bib.bib11) 专注于幻觉检测和生成论断的事实支持。然而,这些基准主要在同质知识上下文中评估输出级事实性,而跨异构知识结构的多跳推理链的正确性尚未得到充分探索。相比之下,TKFQA 使用反事实链评估对表格、文本和知识图谱的接地推理,从而能够联合评估答案正确性、推理链准确率和输入顺序鲁棒性。

##### 基于结构化知识的 LLM 接地。

现有的接地推理方法可大致分为免训练方法和基于 LoRA 的方法。免训练方法,如 [CoT-D](https://arxiv.org/html/2608.07838#bib.bib12) 和 [ReAct](https://arxiv.org/html/2608.07838#bib.bib14),在不更新模型参数的情况下引出中间推理。基于 LoRA 的方法引入专门的注意力机制,以改善跨证据交互和多跳推理。例如,TXH 使用额外跳注意力构建全局上下文化的表示,而 [PMFT](https://arxiv.org/html/2608.07838#bib.bib16) 研究上下文打乱下的双向注意力。然而,这些方法主要关注同质知识结构或通用的跨上下文交互,并未显式建模异构知识上下文之间的拓扑依赖以保持事实一致性。我们提出的框架解决了这些局限。

## 3 TKFQA

参见图 1:TKFQA 构建流程概览。我们首先构造跨表格、文本段落和知识图谱子图的反事实上下文和反事实证据链。然后生成问题,随后进行自动验证和人工审查。

我们首先从 Wikipedia 和 Wikidata 知识图谱[Vrandečić 和 Krötzsch, 2014](https://arxiv.org/html/2608.07838#bib.bib35)收集源数据,选择具有非空列标题且至少包含一个实体链接单元格的 Wikipedia 表格。然后,我们获取与所选表格关联的文本段落,并从 Wikidata 为这些段落中提到的实体检索相关知识图谱[Chen 等, 2020](https://arxiv.org/html/2608.07838#bib.bib18)。这些文本、表格和知识图谱将作为后续反事实上下文构造的源材料。

##### 反事实上下文生成。

尽管 LLM 已在广泛任务中展现出强大的推理能力[Liu 等 (2025b)](https://arxiv.org/html/2608.07838#bib.bib38);[Jiang 等 (2026)](https://arxiv.org/html/2608.07838#bib.bib40),但先前研究[Tang 等 (2024)](https://arxiv.org/html/2608.07838#bib.bib36);[Xu 等 (2024)](

相似文章

面向事实的推理学习

arXiv cs.CL

本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。

TriQua:调和事实性评估中的粒度与上下文

arXiv cs.AI

本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。