TriQua:调和事实性评估中的粒度与上下文

arXiv cs.AI 论文

摘要

本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。

arXiv:2608.05228v1 Announce Type: new 摘要:“先分解后验证”的LLM事实性评估范式面临一个基本权衡:原子事实(即一个句子传达一个信息单位)往往遗漏必要的上下文,而更宽泛的陈述则缺乏精确评估所需的粒度。为了解决这个问题,我们引入了TriQua,一个根据事实复杂性灵活建模的框架。简单声明被提取为标准三元组,而复杂声明则通过附加辅助上下文限定符表示为超关系事实。这种自适应结构在保留准确检索和验证所需上下文的同时,不牺牲原子性。此外,TriQua的验证过程直接在特定三元组和限定符中标注具体错误,为错误检测提供细粒度的可解释性。与该框架一起,我们提出了TriQuaScore来量化这些结构化事实单元的事实性。实证评估表明,TriQuaScore与人工标注的事实性得分高度一致,TriQua实现了稳健的分解质量,并在基于证据的事实验证中优于现有的基于分解的框架。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:46

# TriQua:在事实性评估中调和粒度与上下文

来源:https://arxiv.org/html/2608.05228
Jin Liu1,2Steffen Thoma1Achim Rettinger1,3 1FZI Research Center for Information Technology, Karlsruhe, Germany 2Karlsruhe Institute of Technology, Karlsruhe, Germany 3Trier University, Trier, Germany \{jin\.liu, thoma, rettinger\}@fzi\.de

###### 摘要

LLM事实性评估中的“分解后验证”范式面临一个基本权衡:原子事实(即一句话传达一个信息单元)往往省略了必要的上下文,而更宽泛的陈述又缺乏精确评估所需的粒度。为了解决这一问题,我们提出了TriQua,一个根据事实复杂性灵活建模事实的框架。简单声明被提取为标准三元组,而复杂声明则通过附加辅助上下文限定符表示为超关系事实。这种自适应结构在不牺牲原子性的前提下,保留了准确检索和验证所需的必要上下文。此外,TriQua的验证过程直接在特定三元组和限定符中标注具体错误,为错误检测提供了细粒度的可解释性。除了框架本身,我们还提出了TriQuaScore来量化这些结构化事实单元的事实性。实证评估表明,TriQuaScore与人工标注的事实性分数高度一致,TriQua实现了稳健的分解质量,并且在基于证据的事实验证中优于现有的基于分解的框架。

TriQua:在事实性评估中调和粒度与上下文

Jin Liu1,2Steffen Thoma1Achim Rettinger1,31FZI Research Center for Information Technology, Karlsruhe, Germany2Karlsruhe Institute of Technology, Karlsruhe, Germany3Trier University, Trier, Germany\{jin\.liu, thoma, rettinger\}@fzi\.de

## 1 引言

大型语言模型(LLM)越来越多地应用于现实世界场景。然而,它们产生事实错误或得不到支持的内容的倾向,仍然是可靠部署的主要障碍。这使得幻觉检测和事实性评估成为构建可信AI系统的关键。事实性评估的主导范式,尤其是对长文本而言,是“分解后验证”方法,即将复杂陈述拆分为更小、更易处理的单元进行验证。Min等人 (2023 (https://arxiv.org/html/2608.05228#bib.bib9)) 提出了“原子事实”,即传达一条信息的短句,作为实现细粒度分析的最小单元。类似地,Hu等人 (2024 (https://arxiv.org/html/2608.05228#bib.bib11)) 将目标文本分解为知识三元组,形式化为\(subject,relation,object\)\(\\text\{subject\},\\text\{relation\},\\text\{object\}\)。虽然原子表示适用于简单、普遍的事实(如“法国位于欧洲。”),但它们在复杂断言上表现不佳。例如,陈述“截至2026年,法国人口为6450万,不包括海外省。”(Wikidata contributors,2026 (https://arxiv.org/html/2608.05228#bib.bib33); Wikipedia contributors,2026 (https://arxiv.org/html/2608.05228#bib.bib34)) 包含一个受时间和地理约束共同修饰的核心断言(见表1 (https://arxiv.org/html/2608.05228#S1.T1))。Song等人 (2024 (https://arxiv.org/html/2608.05228#bib.bib14)) 最近的工作部分解决了这一问题,将文本分解为“可验证声明”,保留必要的修饰语以维持原断言的完整性。然而,将多条修饰信息捆绑到单个声明中违反了原子性原则。因此,在基于精确率的事实性指标中,单一的错误修饰语(例如错误的年份)会导致整个声明得分为0,从而不公平地惩罚了正确的断言。

表1:对包含简单和复杂声明的文本进行分解提取的比较。虽然RefChecker和VeriScore等基线难以在原子性和上下文之间取得平衡,但我们的TriQua框架通过原生支持简单事实(独立基础三元组)和复杂事实(基础三元组配以独立限定符)来灵活适应。这种双重表示防止了不公平的惩罚,并实现了可解释的验证。这呈现出一个基本权衡:在保留可验证声明的更广泛上下文时,原子事实的细粒度会丢失,而上下文对于准确验证往往至关重要。尽管已有工作如Wang等人 (2024 (https://arxiv.org/html/2608.05228#bib.bib12));Metropolitansky和Larson (2025 (https://arxiv.org/html/2608.05228#bib.bib19)) 已经涉及原子性和上下文问题,但尚未建立全面的解决方案。为应对这一挑战,我们从结构化知识表示中汲取灵感,并将其应用于非结构化文本上的开放信息抽取(OpenIE)。在本文中,我们提出了一个通过两种不同表示来处理不同文本复杂度的框架:简单事实被纯提取为原子的\(subject,relation,object\)\(\\text\{subject\},\\text\{relation\},\\text\{object\}\)基础三元组,而复杂事实则通过将基础三元组与一组独立限定符配对来表示(如表1 (https://arxiv.org/html/2608.05228#S1.T1)所示)。基础三元组捕获类似于原子事实的核心信息,而限定符则用于注释和情境化这一核心断言,附带必要的空间、时间、因果或其他修饰信息。通过这种方式,我们的方法协调了先前两种方法的优势,实现了一个既高度细粒度又具有上下文感知的事实验证框架。

在此分解基础上,我们提出了一种基于关系的事实精确率指标。由于我们的架构将基础三元组与其各种限定符清晰地分离开来,当某个事实单元得不到支持时,验证过程可以明确标注哪一个具体组件(基础三元组或特定限定符)是错误的。这种有针对性的标注提供了细粒度的可解释性,从而使指标能够分配部分分数,而不是因单一错误修饰语而惩罚整个声明。最终,这在保留后续检索和验证所需的所有上下文信息的同时,实现了对事实性的更高诊断性评估。

总而言之,我们的主要贡献如下:

- •我们提出了TriQua,一个基于OpenIE的分解框架,将简单事实表示为基础三元组,将复杂事实表示为带限定符的基础三元组,同时保留原子性和上下文约束。
- •我们引入了TriQuaScore,一种基于关系的事实精确率指标,支持部分评分和局部错误归因。
- •我们基于指标对齐、分解质量和短声明事实检查对TriQua与基于分解的基线进行评估,展示了事实性评分的改进和更可解释的验证。

## 2 相关工作

分解与去上下文化:LLM生成内容的事实性评估通常依赖于“分解后验证”范式,由FactScore (Min等人,2023 (https://arxiv.org/html/2608.05228#bib.bib9)) 开创。然而,这种方法的主要挑战在于,提取严格原子的事实往往会剥离必要的上下文信息。为了解决这些局限性,特别是在开放生成场景中的上下文保留和可验证性问题,后续框架如Factcheck-GPT (Wang等人,2024 (https://arxiv.org/html/2608.05228#bib.bib12))、SAFE (Wei等人,2024a (https://arxiv.org/html/2608.05228#bib.bib13))、VeriScore (Song等人,2024 (https://arxiv.org/html/2608.05228#bib.bib14))、Molecular Facts (Gunjal和Durrett,2024 (https://arxiv.org/html/2608.05228#bib.bib15)) 和DnDScore (Wanner等人,2025 (https://arxiv.org/html/2608.05228#bib.bib17)) 扩展了最初的FactScore方法。大多数框架将提取的事实表示为句子,而其他框架则采用更结构化的表示。RefChecker (Hu等人,2024 (https://arxiv.org/html/2608.05228#bib.bib11)) 使用知识三元组,QASemConsistency (Cattan等人,2026 (https://arxiv.org/html/2608.05228#bib.bib18)) 通过谓词-参数命题(以问答对形式表示)来表示事实内容,以评估生成文本的事实性。去上下文化在不同系统中也有所不同。SAFE、Molecular Facts和DnDScore在分解后专门执行去上下文化步骤。相比之下,Factcheck-GPT和VeriScore将分解和去上下文化合并为统一步骤,我们的框架也采用了这一方式。此外,去上下文化的具体目标在文献中也各不相同:SAFE专注于解析代词和定指指代;Molecular Facts和DnDScore优先考虑实体消歧和最小性;VeriScore则针对空间和时间修饰语。虽然VeriScore的“修饰语”与我们所提出的“限定符”概念高度一致,但我们的方法更加系统、高度结构化,并旨在覆盖更广泛的上下文类型。

分解质量检查:近期一些研究解决了评估分解质量的挑战。Hu等人 (2025 (https://arxiv.org/html/2608.05228#bib.bib16)) 强调这一过程中的陷阱,对典型错误进行了分类,包括上下文遗漏、歧义、过度分解和改变原意。为了定量衡量分解成功程度,Wanner等人 (2024 (https://arxiv.org/html/2608.05228#bib.bib10)) 引入了DecomposeScore,计算由原始文本准确支持的子声明的比例。在扩展多维评估方面,Metropolitansky和Larson (2025 (https://arxiv.org/html/2608.05228#bib.bib19)) 提出了CLAIMIFY框架,从蕴含、去上下文化和覆盖度三个维度评估分解质量。类似地,FactLens基准 (Mitra等人,2025 (https://arxiv.org/html/2608.05228#bib.bib20)) 通过与人工标注比较来评估原子性、充分性、捏造性和冗余性等指标。

事实性指标:FactScore将事实性衡量为精确率:在所有分解事实中得到支持的事实所占的比例。仅使用精确率评分的一个局限性是,较短的回复可以通过提出较少的声明来获得虚高的分数。SAFE通过定义目标事实数量KK并报告召回率和F1@KF1@K来解决这个问题,这一想法后来被VeriScore采用。VeriFact (Liu等人,2025 (https://arxiv.org/html/2608.05228#bib.bib21)) 类似地使用LLM生成和人工生成的参考事实来估计召回率。由于选择KK或构建参考事实会引入额外的主观性,TriQua专注于事实精确率,同时改进所计数事实单元的粒度。

结构化知识表示:TriQua建立在结构化知识表示的既有思想之上,包括n元关系 (Noy等人,2006 (https://arxiv.org/html/2608.05228#bib.bib39))、Wikidata风格限定符 (Vrandečić和Krötzsch,2014 (https://arxiv.org/html/2608.05228#bib.bib38)) 和超关系事实 (Rosso等人,2020 (https://arxiv.org/html/2608.05228#bib.bib40); Wei等人,2024b (https://arxiv.org/html/2608.05228#bib.bib23))。这些形式化方法通过额外的参数或限定符对来扩展标准三元组,以表示上下文约束。TriQua将这一思想应用于基于OpenIE的LLM非结构化生成内容的事实性评估。

## 3 方法

在本节中,我们介绍所提出的TriQua框架中用于细粒度事实性评估的组件。我们的框架同样遵循分解后验证范式。我们首先介绍核心组件,即分解器、检索器和验证器。除了组件之外,我们还基于验证结果介绍了我们自己的事实性指标。

### 3.1 分解

#### 3.1.1 事实表示

虽然大多数现有的分解后验证框架将提取的事实表示为非结构化句子,但TriQua采用了一种受\(subject,relation,object\)\(\\text\{subject\},\\text\{relation\},\\text\{object\}\)三元组启发的结构化方法。然而,标准三元组难以捕获复杂的上下文细节,例如对准确验证往往至关重要的时间或条件约束。为了克服这一限制,TriQua采用了超关系事实表示 (Wei等人,2024b (https://arxiv.org/html/2608.05228#bib.bib23)),该表示为基础三元组附加辅助的限定符-值对。我们将事实定义如下:

- •简单事实表示为标准三元组:\(subject,relation,object\)\(\\text\{subject\},\\text\{relation\},\\text\{object\}\)
- •复杂事实表示为由mm个限定符修饰的基础三元组:\(\(subject,relation,object\),\{\(qi,vi\)\}i=1m\)\(\(\\text\{subject\},\\text\{relation\},\\text\{object\}\),\\\{\(q\_\{i\},v\_\{i\}\)\\\}\_\{i=1\}^\{m\}\),其中qiq\_\{i\}是第ii个限定符标签,viv\_\{i\}是其对应的限定符值。

#### 3.1.2 限定符的使用

遵循Aljalbout等人 (2023 (https://arxiv.org/html/2608.05228#bib.bib22)) 的做法,我们将限定符分为验证性上下文(如时间或空间)、因果性、顺序、来源和注解(如约束或属性)。限定符仅在必要时使用。如果某个一般实体属性不直接修饰基础三元组的断言,则应将其提取为独立的简单事实,而不是附加为限定符。此外,一个基础三元组可以有多个限定符。我们遵循Wikidata的约定以防止歧义:限定符只能修饰基础三元组,而不能修饰其他限定符 (Vrandečić和Krötzsch,2014 (https://arxiv.org/html/2608.05228#bib.bib38); Wikidata contributors,2026 (https://arxiv.org/html/2608.05228#bib.bib33))。

#### 3.1.3 少样本开放信息抽取

我们的分解遵循开放信息抽取范式,无需预定义的本体。此外,该过程被严格限制为仅抽取事实信息。在上述规则指导下,我们利用少样本学习从目标文本中提取客观事实以供后续验证。我们的框架具有高度适应性,支持句子级和文档级分解。对于文档级文本,我们使用LangChain (Chase,2022 (https://arxiv.org/html/2608.05228#bib.bib35)) 中的递归文本分割器。该工具将文本划分为可调整大小的不重叠块,优先考虑自然语义边界,按段落、行和句子顺序进行切分。在分解某个块时,我们还将紧邻的前一个块作为上下文提供。提示根据两个输入条件进行实例化:是否有原始用户问题,以及是否需要分块。这产生了四种模式:有问题/无问题和分块/不分块。问题(如果可用)为解析未充分指定的指代提供任务上下文。前一个块(如果可用)提供局部上下文。模式的具体细节见附录A.1 (https://arxiv.org/html/2608.05228#A1.SS1)。精确的提示模板见附录A.2.1 (https://arxiv.org/html/2608.05228#A1.SS2.SSS1)和附录A.2.2 (https://arxiv.org/html/2608.05228#A1.SS2.SSS2)。

### 3.2 检索

由于我们的抽取流水线依赖于开放信息抽取,且没有预定义的...

相似文章

基于策略性标注的人类锚定事实性评估

arXiv cs.CL

本文引入了一种使用失败空间分析的特定于事实性的标注策略,以在有限的标注预算下改善针对大语言模型的人类锚定事实性评估,并在基准系统上取得了显著的效率提升。

面向事实的推理学习

arXiv cs.CL

本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。