通过TRIAD自动化多跳RAG评估:从上下文提取到验证数据集生成
摘要
本文介绍TRIAD,一种三阶段自动化方法,用于生成验证数据集,以评估特定领域设置下的多跳RAG系统,并与既定基准进行比较。
arXiv:2608.21558v1 公告类型:新
摘要:大语言模型的最新进展和工业界RAG系统的采用,产生了对特定领域问答数据集的需求,这些数据集能够评估RAG在专有数据上的性能。现有的数据集,如HotpotQA,在基于维基百科的知识上挑战当前的RAG系统,但它们不能直接转移到特定领域设置。对RAG系统质量的综合评估需要多跳查询和不可回答的问题。本文介绍TRIAD,一种三阶段自动化数据集生成方法。首先,它为RAG系统的特定领域知识库生成问答对。其次,验证器在反馈循环中检查每个问答对。第三,问答对通过相关性标记的上下文文档进行扩展,用于下游评估。我们将这种方法与既定的MuSiQue和HotpotQA数据集进行评估。结果显示,生成的跨不同RAG设置的数据集表现出相似的性能趋势,而人工验证表明这些问题适合评估特定领域RAG系统。用于生成数据集的所有代码和验证结果可在我们的GitHub仓库(https://github.com/lorenzbrehme/triad)中找到。
查看缓存全文
缓存时间: 2026/08/25 04:13
# 通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成 来源:https://arxiv.org/html/2608.21558 ## 通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成 致谢:论文已被第19届国际自然语言生成会议(INLG 2026)收录 Lorenz Brehme 单位:因斯布鲁克大学 单位:计算机科学系 单位:奥地利因斯布鲁克 邮箱:[[email protected]](mailto:) Adam Jatowt 单位:因斯布鲁克大学 单位:计算机科学系 单位:奥地利因斯布鲁克 邮箱:[[email protected]](mailto:) ###### 摘要 大型语言模型的最新进展以及RAG系统在工业界的应用,催生了对领域特定问答数据集的需求,这些数据集可用于评估RAG系统在私有数据上的性能。现有数据集(如HotpotQA)主要基于维基百科知识挑战当前RAG系统,但无法直接迁移到领域特定场景。对RAG系统质量的全面评估既需要多跳查询,也需要无法回答的问题。本文介绍了TRIAD,一种三阶段自动化数据集生成方法。首先,它为RAG系统的领域特定知识库生成问答对。其次,验证器在反馈循环中检查每个问答对。最后,为问答对扩展带相关性标签的上下文文档,用于下游评估。我们使用已建立的MuSiQue和HotpotQA数据集对该方法进行评估。结果显示,生成的数据集在不同RAG配置下表现出相似的性能趋势,而人工验证表明这些问题适用于评估领域特定RAG系统。用于生成数据集的所有代码和验证结果均可在我们的GitHub仓库中获取(https://github.com/lorenzbrehme/triad)。 ## 1 引言 检索增强生成(RAG)发展迅速Brehme等人2025a(https://arxiv.org/html/2608.21558#bib.bib1),催生了众多改进和评估RAG系统的方法Yu等人2024(https://arxiv.org/html/2608.21558#bib.bib37)。评估框架如RAGASEs等人2023(https://arxiv.org/html/2608.21558#bib.bib7)可同时评估检索器和生成器组件。检索器评估通过比较检索到的上下文与预定义的相关性标签,或使用人工标注者或LLM的相关性判断,来衡量系统是否返回与查询相关的上下文文档。生成器评估则关注RAG回答的质量。短答案通常可使用精确匹配指标进行评估,而较长答案则需要人工或LLM评判Ding等人2024(https://arxiv.org/html/2608.21558#bib.bib6);Es等人2023(https://arxiv.org/html/2608.21558#bib.bib7);Saad-Falcon等人2024(https://arxiv.org/html/2608.21558#bib.bib30)。重要标准包括正确性Yang等人2024(https://arxiv.org/html/2608.21558#bib.bib35)和对检索上下文的忠实度Liu等人2024(https://arxiv.org/html/2608.21558#bib.bib22);Ru等人2024(https://arxiv.org/html/2608.21558#bib.bib29)。这些评估依赖于包含至少问题、并常包含参考答案或标注的相关上下文等额外属性的问答数据集Yang等人2018(https://arxiv.org/html/2608.21558#bib.bib36)。一个关键区别在于单跳问题(可从单个文档回答)和多跳问题(需要综合多个来源的信息)Yang等人2018(https://arxiv.org/html/2608.21558#bib.bib36)。多跳评估之所以重要,是因为RAG系统必须有效整合来自多个来源的信息才能回答问题Tang和Yang 2024(https://arxiv.org/html/2608.21558#bib.bib32);Brehme等人2026(https://arxiv.org/html/2608.21558#bib.bib4)。 现有多个针对多跳问题的数据集,包括带上下文相关性标签的数据集,如HotpotQAYang等人2018(https://arxiv.org/html/2608.21558#bib.bib36)和MuSiQueTrivedi等人2022(https://arxiv.org/html/2608.21558#bib.bib33)。这些数据集的一个局限是仅限于特定领域。然而,在实际RAG评估中,底层知识库通常是私有的且不公开。因此,公开基准无法全面测试系统在目标语料库上的行为,这有必要创建自定义的问答集。一种选择是手动创建此数据集Schimanski等人2024(https://arxiv.org/html/2608.21558#bib.bib31)。这种方法劳动密集且成本高昂,因为需要专家标注者。另一种选择是使用LLM生成数据集。已有许多框架解决合成数据集的生成问题Pu等人2024(https://arxiv.org/html/2608.21558#bib.bib26)。然而,其中大多数专注于相对简单的单跳查询,无法完全反映RAG的需求Krishna等人2024(https://arxiv.org/html/2608.21558#bib.bib18)。其他框架支持多跳问题生成,但通常需要大量预处理,例如从文档构建知识图谱Lee等人2025(https://arxiv.org/html/2608.21558#bib.bib20);Chen等人2025(https://arxiv.org/html/2608.21558#bib.bib5)或预先标注每个文档Park等人2025(https://arxiv.org/html/2608.21558#bib.bib25);Filice等人2025(https://arxiv.org/html/2608.21558#bib.bib8)。此外,许多现有方法不包括无法回答的问题。这些问题对于评估RAG系统在上下文不足时是产生幻觉答案还是正确拒绝回答至关重要Ravi等人2024(https://arxiv.org/html/2608.21558#bib.bib27)。创建用于评估RAG系统的QA数据集的难度也反映在当前工业应用中:尽管公司越来越多地部署RAG技术,但它们仍难以进行可靠的系统评估Brehme等人2025a(https://arxiv.org/html/2608.21558#bib.bib1)。 在这项工作中,我们提出了TRIAD,一种用于自动生成带标签上下文文档和无法回答问题的多跳QA数据集的三阶段方法。我们的方法利用了RAG系统已有的向量数据库,无需复杂预处理,直接生成可用于评估的QA数据集,从而实现可直接部署的评估设置。这使得能够为领域特定RAG语料库创建评估数据集,而不是将评估限制于预定义的基准知识。我们通过手动评估生成问题的质量和验证器的行为,以及将所得数据集与已建立的HotpotQA和MuSiQue基准进行比较来验证该方法,以确定它们在七种不同RAG配置下是否表现出相似的性能趋势。本研究作为所提管道的基础性验证,展示了其生成可靠评估数据集同时保留不同RAG系统间有意义的性能区分的能力。生成的数据集展示了高质量,可回答性和正确性均超过90%。与现有基准相比,RAG系统在生成的问题上表现更好,但数据集在测试的RAG配置中仍表现出相似的性能趋势。此外,生成的问题不限于特定知识源,且易于适应。实验的所有代码和数据均可在我们的GitHub仓库中获取Brehme和Jatowt 2026(https://arxiv.org/html/2608.21558#bib.bib2)。 ## 2 相关工作 多跳问题需要结合不同的知识片段来生成答案Mavi等人2024(https://arxiv.org/html/2608.21558#bib.bib23)。已有多个为此目的引入的数据集,包括MuSiQueTrivedi等人2022(https://arxiv.org/html/2608.21558#bib.bib33)、2WikiMultiHopQAHo等人2020(https://arxiv.org/html/2608.21558#bib.bib14)和HotpotQAYang等人2018(https://arxiv.org/html/2608.21558#bib.bib36)。Yang等人2018(https://arxiv.org/html/2608.21558#bib.bib36)引入了不同的问题类型,包括比较两个实体的比较问题,以及用一个桥接实体连接两个文档信息的桥接问题。多跳问答中的另一个重要概念是上下文相关性。这指的是上下文是否与回答给定问题相关Saad-Falcon等人2024(https://arxiv.org/html/2608.21558#bib.bib30)。在HotpotQA和MuSiQue等数据集中,每个问题都关联一组标注为相关或不相关的上下文文档。这些标签可用于检索器评估Brehme等人2025b(https://arxiv.org/html/2608.21558#bib.bib3)。然而,这些数据集是手工创建的,并针对其特定源语料库量身定制。因此,它们无法评估RAG特有的知识,因此不适合评估在领域特定语料库上运行的RAG系统。为解决这一限制,可以使用LLM自动生成QA数据集。已有多个框架解决了此类问题的自动生成Park等人2025(https://arxiv.org/html/2608.21558#bib.bib25);Tang和Yang 2024(https://arxiv.org/html/2608.21558#bib.bib32)。其中许多方法包含预处理步骤,在此构建知识图谱Lee等人2025(https://arxiv.org/html/2608.21558#bib.bib20);Chen等人2025(https://arxiv.org/html/2608.21558#bib.bib5)。然后使用该图谱来识别相关实体和支持文档以进行问题生成。另一种方法通过添加新文档来迭代重写问题,从而创建多跳问题Hwang等人2024(https://arxiv.org/html/2608.21558#bib.bib15)。相关的工作旨在通过具有多个可能答案来触发RAG系统,从而创建模糊问题Ji等人2025(https://arxiv.org/html/2608.21558#bib.bib16)。这使得能够在涉及不完整或不确定信息的设置中评估RAG系统。评估RAG系统的另一个方面是它如何对无法回答的问题做出反应。Liu等人2026(https://arxiv.org/html/2608.21558#bib.bib21)解决了这个问题,他们首先生成多跳查询,然后使用通过网络搜索获得的公共知识对其进行修改。然而,这种方法仅限于通用知识,无法转移到领域特定场景,在这些场景中无法从外部来源获得相关信息。为了获得无需如此复杂预处理并包含用于无法回答问题的不相关上下文的多跳数据集,我们引入了为复杂问题生成多跳QA集的方法。此外,我们定义了不同的问题类型以触发不同的检索器行为。 ## 3 TRIAD方法论 图1:TRIAD方法概述 在本节中,我们介绍TRIAD,一种用于生成带标签上下文文档的多跳问题的三阶段方法(参见图1(https://arxiv.org/html/2608.21558#S3.F1))。它包括生成、验证和提取:问题首先根据源内容和类型需求创建,然后验证其质量和多跳推理能力,最后与相关和不相关文档配对形成带标签的上下文列表。 ### 3.1 生成 生成阶段基于回答问题所需的文档创建问题。首先,从RAG语料库中选择初始文档¹。这可以手动完成,也可以随机采样文档。然后使用初始文档通过向量存储查询相似条目来检索一组额外文档²。一旦获得该集合,必须识别一个桥接主题³来连接这些片段并支持QA生成。对于此步骤,LLM被提示为检索到的片段生成一个桥接主题。如果没有桥接主题,则返回空字符串。此外,LLM为每个片段输出一个潜在桥接主题列表。当所有片段没有共同的桥接主题时,使用此列表。在这种情况下,会选择另一个初始片段,并再次检索top-n个相似文档。然后,我们通过精确匹配检查每个检索到的文档是否包含候选桥接主题。我们只保留满足所需数量片段共享相同桥接主题的配置。如果未找到有效配置,则使用初始候选列表中的下一个片段并重复该过程。如果无法识别共同主题,则流水线重新启动。否则,我们获得一个文档集和相应的桥接主题。下一步是问题生成⁴。对于此步骤,LLM被提示使用桥接主题、文档集、问题类型以及问题应满足的目标角色。LLM输出问题和相应的答案。这会产生一个样本,包含问题、答案、相关上下文文档集以及相关的类型和角色标签。 #### 3.1.1 问题类型 为了获得多样化的示例集,我们定义了三种多跳问题类型——比较、交集和组合——以及两个额外的交叉类别:二元和时间性(参见表1(https://arxiv.org/html/2608.21558#S3.T1))。我们还考虑将无法回答的问题作为一个单独类别。 ##### 多跳问题类型。 三种多跳问题类型的特征是两种不同的检索模式:并行检索和顺序检索。第一种模式是并行检索。在这种情况下,问题本身已包含足够的信息来直接检索所有相关片段,因为所有关键实体都被明确提及。例如:“哪个城市人口更多,伦敦还是纽约?”在这种情况下,检索器可以直接使用“伦敦”和“纽约”作为查询锚点,并行检索相关片段。这种并行检索模式被比较和交集问题类型使用。比较类型对比多个实体以得出答案,而交集类型过滤或聚合实体,例如:“哪位演员出演了《盗梦空间》和《星际穿越》两部电影?”第二种检索模式是顺序检索。在此,查询的结构使得必须先从问题的部分中识别一个中间实体。必须先检索到该实体,然后才能解决剩余部分的问题,之后才能检索下一个片段以产生最终答案。此模式包括组合问题类型。考虑问题:“A先生出生地所在国家的首都是什么?”首先,RAG系统必须检索关于A先生的信息以确定其出生地。然后,它使用该出生地检索关于该地点的信息并确定其首都。这个推理过程无法通过单步检索所有片段来完成。它需要顺序检索,而简单的单步RAG架构不支持此操作。 ##### 交叉类别问题。 除了这些检索模式外,我们还定义了两个交叉类别问题。一个是二元问题(即是非问题),可应用于所有检索模式。另一个是时间性问题,需要在问题中进行时间推理。时间性问题在后续步骤中分类。具体来说,我们使用LLM对
相似文章
在应用场景中评估RAG指标:一项实验、发现与局限性
本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。
少即是多:通过多信号晚期融合实现无图谱多模态RAG
TrioRAG是一个无图谱的多模态RAG框架,使用多信号晚期融合来实现高效的跨文档问答,性能匹配或超越基于图谱的系统。此外,它引入了AutoQA,一个基于网络图像的汽车基准测试。
文本-图协同:用于 RAG 的双向验证与补全框架
本文介绍了 TGS-RAG,这是一个双向验证与补全框架,通过协同基于文本和基于图的检索增强生成(RAG),提高了多跳推理的准确性。
参数与上下文:面向鲁棒检索增强生成的TRACE微调
本文提出TRACE,这是一个用于检索增强生成(RAG)的微调框架,它使用多智能体辩论轨迹和答案完整性正则化来处理知识冲突,从而提高对误导性上下文的鲁棒性并减少不完整答案。
ContextRAG:面向检索增强生成的无抽取层次图构建
ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。