MTR-Suite:一个用于评估和合成对话检索基准的框架
摘要
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。
arXiv:2605.20729v1 公告类型:新
摘要:准确评估对话检索对于推进检索增强生成(RAG)系统至关重要。然而,现有的对话检索基准存在成本高昂、人工标注稀疏,或僵化、不自然的自动启发式方法等问题。为了解决这些挑战,我们提出了MTR-Suite,一个用于审计、合成和基准测试检索的统一框架。其特点包括:(1) MTR-Eval,一个基于LLM的审计器,用于量化先前基准中的对齐差距;(2) MTR-Pipeline,一个多智能体系统,使用贪心遍历聚类以1/400的人工成本生成高保真对话;以及(3) MTR-Bench,一个严谨的通用领域基准。MTR-Bench模拟生产级挑战(硬话题切换、冗长),提供卓越的区分能力。我们将代码和数据公开,以促进未来研究,地址:https://github.com/rangehow/mtr-suite。
查看缓存全文
缓存时间: 2026/05/21 06:34
# MTR-Suite: 评估与合成对话检索基准的统一框架 来源:https://arxiv.org/html/2605.20729 阮俊豪1,2,阿卜杜克尤木·阿布都拉1,李贝2,尹永晶2, 刘新宇1,焦克晨4,陈鑫2,王金港2, 蔡勋良2,肖桐1,322:2,朱靖波1,3 1东北大学计算机科学与工程学院, 沈阳 110819, 中国 2美团, 3NiuTrans Research, 沈阳, 中国 4清华大学, 北京, 中国 [email protected] **摘要** 准确评估对话检索对于推进检索增强生成(RAG)系统至关重要。然而,现有的对话检索基准存在成本高昂、人工标注稀疏或基于刚性、不自然的自动化启发式方法等问题。为应对这些挑战,我们提出了 **MTR-Suite**,一个用于审计、合成和基准测试检索的统一框架。它包含:\(1\) **MTR-Eval**,一个基于LLM的审计器,用于量化先前基准中的对齐差距;\(2\) **MTR-Pipeline**,一个使用贪心遍历聚类的多智能体系统,以1/400的人力成本生成高保真对话;以及 \(3\) **MTR-Bench**,一个严谨的通用领域基准。**MTR-Bench** 模拟了生产环境中的挑战(硬主题切换、冗长性),具有卓越的区分能力。我们将公开代码和数据以促进未来研究。111https://github.com/rangehow/mtr-suite MTR-Suite: 评估与合成对话检索基准的统一框架 阮俊豪1,2††:工作完成于美团实习期间,阿卜杜克尤木·阿布都拉1,李贝2††:通讯作者,尹永晶2,刘新宇1,焦克晨4,陈鑫2,王金港2,蔡勋良2,肖桐1,322:2,朱靖波1,3 1东北大学计算机科学与工程学院,沈阳 110819,中国 2美团 3NiuTrans Research,沈阳,中国 4清华大学,北京,中国 [email protected] 参见图注 图1:顶部:符号定义。第二行:人类认知边界的图示。第三行:MTR-Eval 审计过程。底部:MTR-Pipeline,合成高质量基准。 \(a\) 证据完整性 查询-证据 答案忠实性 答案质量 2.0 2.0 3.0 3.0 4.0 4.0 5.0 5.0 3.7 3.7 3.9 3.9 4.1 4.1 4.0 4.0 3.8 3.8 3.7 3.7 3.4 3.4 2.4 2.4 3.3 3.3 3.5 3.5 3.9 3.9 3.1 3.1 2.7 2.7 3.2 3.2 3.6 3.6 3.4 3.4 2.1 2.1 3.3 3.3 3.1 3.1 3.4 3.4 2.5 2.5 2.2 2.2 2.2 2.2 3.6 3.6 4.7 4.7 4.8 4.8 4.8 4.8 4.9 4.9 QReCC Doc2Dial QuAC TopiOCQA Inscit CORAL MTR-Bench \(b\) QReCC QuAC Doc2Dial TopiOCQA MTR-Bench 25 25 40 40 55 55 70 70 85 85 100 100 大性能差距 高区分能力 性能 gte-Qwen2-7B stella_en_400M_v5 gte-ModernBert-base bge-Large-en-v1.5 Dragon-ChatQA 图2:\(a\) 使用我们提出的 MTR-Eval 指标对多个强大的开源 LLM 在不同数据集上的平均定量分析结果。每个模型在所有基准上的详细得分热图见附录 A.1 (https://arxiv.org/html/2605.20729#A1.SS1)。\(b\) 流行开源检索器在不同基准上的 Recall@20 得分。注意 MTR-Bench 中较大的性能差距,突显了其相比先前基准的区分能力。 \\phantomsubcaption \\phantomsubcaption ## 1 引言 检索增强生成(RAG)已成为将大型语言模型(LLM)锚定于可验证外部知识的标准范式\(Lewis 等,2020 (https://arxiv.org/html/2605.20729#bib.bib73);OpenAI,2023 (https://arxiv.org/html/2605.20729#bib.bib79);Gemini 等,2024 (https://arxiv.org/html/2605.20729#bib.bib18);DeepSeek-AI 等,2024 (https://arxiv.org/html/2605.20729#bib.bib80)\)。通过缓解静态参数记忆固有的幻觉\(Xu 等,2025 (https://arxiv.org/html/2605.20729#bib.bib69)\),RAG 扩展了模型的能力,这些能力进一步通过工具使用\(Schick 等,2023 (https://arxiv.org/html/2605.20729#bib.bib27)\)和测试时扩展\(OpenAI 等,2024 (https://arxiv.org/html/2605.20729#bib.bib72);DeepSeek-AI 等,2025 (https://arxiv.org/html/2605.20729#bib.bib71)\)得到增强。然而,任何 RAG 系统的有效性都受限于其检索模块的性能。如果检索器无法找到准确的对话上下文,生成层将变得无效。因此,评估对话检索阶段至关重要。 传统的人工标注面临一个基本的**认知边界**\(Zobel, 1998 (https://arxiv.org/html/2605.20729#bib.bib102);Buckley and Voorhees, 2004 (https://arxiv.org/html/2605.20729#bib.bib103)\)。标注者通常以“局部视图”操作,仅根据他们正在阅读的特定文档来构建查询。他们缺乏全局视角,无法知道语料库中的其他文档是否也能(可能更好地)回答该查询。这导致**标注稀疏性**,使得有效的检索结果被错误地判定为假阴性。此外,严格的隐私约束使得人工标注在高价值专有领域(例如金融、法律)中往往不可行。 理想情况下,自动化合成应能克服这些人类限制。然而,先前的尝试如 CORAL\(Cheng 等,2024 (https://arxiv.org/html/2605.20729#bib.bib67)\) 不自觉地继承了类似的挑战。通过依赖静态启发式方法,例如直接将维基百科章节标题转换为问题,这些方法在方法论边界内运作,这反映了人类的局部视图。它们假设从特定文档结构生成的查询与该文档唯一对齐。正如我们的审计所表明的(第3节 (https://arxiv.org/html/2605.20729#S3)),如果没有全局验证,这种方法可能导致对齐问题:生成的查询可能模棱两可,或者可以由语料库中其他地方未标注的文档更好地回答。因此,现有的自动化方法用效率换取了人类的高成本,但标注稀疏性的挑战仍未完全解决。 为弥合这一差距,我们认为高保真基准测试需要从局部启发式方法过渡到**全局感知的自动化标注**。我们提出 **MTR-Suite** (图1 (https://arxiv.org/html/2605.20729#S0.F1)),一个用于审计、合成和基准测试对话检索系统的统一框架。**MTR-Suite** 通过三项集成贡献提供了整体解决方案: - **诊断性审计 (MTR-Eval)**:我们提出了首个细粒度评估方法,旨在科学量化检索基准的质量。我们的实验表明,虽然自动化基线存在语言退化问题,但即使是人工标注的数据集也表现出显著的稀疏性诱导噪声。**MTR-Eval** 与人类判断高度相关,为数据集完整性提供了可靠指标 (图2 (https://arxiv.org/html/2605.20729#S0.F2))。 - **多智能体合成 (MTR-Pipeline)**:我们引入了一个完全自动化的框架,用于构建多轮检索数据集。与基于规则的先前工作不同,我们的流水线利用由贪心遍历聚类算法驱动的复杂多智能体架构。这种方法确保了查询的唯一性和语言自然性,以极低的成本(1/400)实现了超越人类标准的标注质量。 - **严谨基准 (MTR-Bench)**:我们开源了 **MTR-Bench**,一个旨在压力测试现代检索器的通用领域数据集。其特点在于包含先前数据集常常忽略的现实对话现象,包括硬主题切换、长上下文模糊性和生产型冗长性,从而为评估主流检索模块提供了显著更高的区分能力 (图2 (https://arxiv.org/html/2605.20729#S0.F2))。 ## 2 相关工作 对话搜索基准的演变反映了标注质量、可扩展性和成本之间的持续平衡。我们将先前的工作分为三个主要范式。 ### 2.1 人工与混合标注 基础数据集如 CoQA\(Reddy 等,2019 (https://arxiv.org/html/2605.20729#bib.bib47)\) 和 QuAC\(Choi 等,2018 (https://arxiv.org/html/2605.20729#bib.bib61)\) 确立了多轮交互的标准,而后续工作则针对特定领域,例如 Doc2Dial\(Feng 等,2020 (https://arxiv.org/html/2605.20729#bib.bib59)\) 中的目标导向对话和 TopiocQA\(Adlakha 等,2022 (https://arxiv.org/html/2605.20729#bib.bib94)\) 中的主题转移。为降低标注成本,混合半合成方法如 TREC CAsT\(Dalton 等,2020 (https://arxiv.org/html/2605.20729#bib.bib58)\) 和 QReCC\(Anantha 等,2021 (https://arxiv.org/html/2605.20729#bib.bib85)\) 将人工改写与机器检索相结合。虽然提高了效率,但它们继承了人工监督的基本局限性,并且难以有效扩展到私有的大规模语料库。尽管这些数据集被视为黄金标准,但它们仍受到引言中讨论的人类认知限制的影响。具体来说,缺乏全局语料库可见性导致了显著的假阴性(可检索证据被标记为不相关)和幻觉查询。如我们的案例研究所展示的(见附录 A.3 (https://arxiv.org/html/2605.20729#A1.SS3)),即使是这些人工精心策划的数据集也表现出相当的噪声和稀疏性。 ### 2.2 自动化基准合成 LLM 的出现将焦点转向了完全自动化的构建。值得注意的例子如 CORAL\(Cheng 等,2024 (https://arxiv.org/html/2605.20729#bib.bib67)\) 通过利用维基百科的层级结构(例如,将章节标题转化为问题)来合成对话。然而,对静态文档结构的依赖可能限制对话的自然性,导致对话反映源文本的组织而非动态的用户意图。Lee 等\(2024 (https://arxiv.org/html/2605.20729#bib.bib105)\) 引入了一个多文档合成流水线。他们依赖刚性规则来强制实施特定的问题类型,这可能会损害对话流畅性,导致不自然的转换,例如对正确回应提出不合逻辑的反驳。该数据集不可用也妨碍了对其质量的评估。 ## 3 MTR-Eval: 审计基准质量 形式上,一个多轮对话检索基准由文档语料库 \(\mathcal{D}=\{d_{1},d_{2},\dots,d_{N}\}\) 组成,其中每个 \(d\) 代表一个单独的文档(或段落),以及一组评估实例。每个实例对应于一个对话轮次 \(i\),表示为一个三元组 \((H_{i},q_{i},G_{i})\)。这里,\(q_{i}\) 是用户当前的查询,而 \(H_{i}=\{(q_{1},a_{1}),\dots,(q_{i-1},a_{i-1})\}\) 表示对话历史。集合 \(G_{i}\subseteq\mathcal{D}\) 包含被标注为与回答 \(q_{i}\) 相关的黄金标准文档。 ### 3.1 质量差距:标注证据 vs. 真实证据 基准测试中的根本挑战在于**标注**的黄金标准集合 \(G_{i}\) 与语料库 \(\mathcal{D}\) 中存在的所有支持文档的**真实**集合 \(\hat{G}_{i}\) 之间的差异。高质量基准必须最小化两种特定错误类型: ##### 标注噪声:当 \(G_{i}\setminus\hat{G}_{i}\neq\emptyset\) 时,基准在黄金集合中包含实际上不相关的文档 \(d\)。这会导致模型性能被高估。 ##### 标注稀疏性:当 \(\hat{G}_{i}\setminus G_{i}\neq\emptyset\) 时,语料库中存在有效的支持文档 \(d\),但标注中缺失。这导致有效的检索结果被错误地判定为假阴性。 ### 3.2 评估指标 为了在没有详尽人工重新标注的情况下量化这些差异,**MTR-Eval** 采用了一种异质性的 LLM 作为法官方法,涵盖四个细粒度维度: ##### 查询-证据对齐:该指标评估特定的标注文档 \(d\in G_{i}\) 是否确实包含 \(q_{i}\) 的答案。LLM 被提供查询和黄金文档;如果 \(d\) 未能支持该查询,则表明存在**标注噪声**,意味着基准包含假阳性。 ##### 证据完整性:衡量**标注稀疏性**很困难,因为枚举大型语料库中的所有相关文档是难以处理的。我们提出一个代理任务:**可区分性测试**。我们将 LLM 置于一个包含黄金文档 \(d_{gold}\in G_{i}\) 和几个检索到的硬负例的候选池中。LLM 被要求识别最相关的文档。如果 LLM 始终选择一个非黄金文档 \(d_{other}\notin G_{i}\) 作为比 \(d_{gold}\) **更**相关,这强烈表明标注期间遗漏了有效证据。该指标惩罚“黄金”文档并非唯一或明确最佳匹配的基准。 ##### 答案-证据忠实性:这评估标注过程中的幻觉。我们验证答案 \(a_{i}\) 是否完全基于其对应的文档集 \(G_{i}\)。 ##### 答案质量:独立于证据,该指标评估响应 \(a_{i}\) 的语言质量(例如,连贯性、对 \(q_{i}\) 的有用性)。 总的来说,这些指标充当数据集的可信度系数。我们方法论的一个关键含义是,检索器只有在具有高**MTR-Eval** 分数的基准上取得高性能才具有重要意义。相反,在 **MTR-Eval** 评级较低的基准上获得高分(如 Recall 或 MRR)价值有限,因为结果很可能被标注噪声和稀疏性所混淆。 ### 3.3 验证 ##### 缺失证据的验证。为验证检测到的稀疏性,我们人工检查了 300 个抽样案例,其中 LLM 识别出一个文档相关,但该文档不在黄金标准中。人工审查确认其中 98% 确实是有效的黄金标准(Fleiss' Kappa 分数低于 0.92),足以完全回答用户查询,这验证了认知边界的存在。更多案例见附录 A.3 (https://arxiv.org/html/2605.20729#A1.SS3)。 ##### 与人类判断的相关性。我们进行了并行的人工标注研究。关键的是,我们的方法通过多 LLM 集成(减少自我偏好偏差)和逐点评分设计(消除位置偏差)来最小化偏差。在多文档场景(如可区分性测试)中,文档位置被进一步随机化。这些设计选择使得自动评分与人类判断高度一致,实现了查询-证据相关性 0.82、答案忠实性 0.89 和答案质量 0.74 的 Pearson 相关系数(所有 \(p\ll 0.001\))。这种高度一致性确认了 MTR-EVAL 是可靠的人类感知代理,与特定模型偏好解耦。更多细节见附录 A.4 (https://arxiv.org/html/2605.20729#A1.SS4)。 ## 4 MTR-Pipeline 为了大规模生成高质量数据,我们提出了 **MTR-Pipeline**。我们将基准构建的复杂任务分解为三个简化的阶段:策展、聚类和多智能体生成。关于递归分块指南、聚类案例研究、智能体模型选择和成本估算明细的详细工程实现细节,请参考附录 A.5 (https://arxiv.org/html/2605.20729#A1.SS5)。 ### 4.1 知识库策展 基准的质量严格受限于其源数据。为确保只使用高质...
相似文章
MTR-DuplexBench:全双工语音语言模型多轮对话的综合评估基准
MTR-DuplexBench为全双工语音语言模型在多轮对话中的评估引入了一个综合基准,解决轮转边界模糊和上下文不一致等挑战,同时评估对话特征、对话质量、指令遵循和安全性。
Enjoy Your Talk: 一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
SMMBench:面向源分布的多模态智能体记忆基准测试
提出SMMBench,一个用于评估多模态智能体从独立来源(如对话、表格和文档)中检索、对齐和组合分散证据能力的基准。实验表明,当前系统在此类源分布记忆组合任务上仍存在困难。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。
MANTRA:为工具使用型 LLM 代理综合生成经 SMT 验证的合规基准
本文介绍了 MANTRA,这是一个从自然语言手册中自动综合生成经 SMT 验证的合规基准的框架,用于评估工具使用型 LLM 代理。研究表明,该方法能够实现对复杂程序规则遵循情况的可扩展且可靠的评估。