UsefulBench:以决策有用信息为目标的信息检索
摘要
UsefulBench 引入了一个领域特定的基准数据集,用于区分信息检索中的文档相关性和有用性,表明基于相似度的信息检索系统混淆了这两个概念,而大语言模型可以解决这个问题但缺乏领域专业知识。
arXiv:2604.15827v1 公告类型:跨领域
摘要:传统信息检索关注于识别文本与给定查询的相关性。然而,相关性的常规定义主要由文本的相似性方面主导,未能观察到文本是否真正有用于解决查询。例如,在回答巴黎是否比柏林更大的问题时,关于巴黎在法国的文本是相关的(词汇/语义相似性),但并不有用。本文介绍了 UsefulBench,这是一个由三位专业分析师标注的领域特定数据集,标注文本是否与查询相关(相关性)或在回答时具有实际价值(有用性)。我们展示了经典的基于相似度的信息检索与相关性更加一致。虽然基于 LLM 的系统可以抵消这种偏差,但我们发现领域特定的问题需要高度的专业知识,而当前的 LLM 并未完全融合这些知识。我们探索了(部分)克服这一挑战的方法。然而,UsefulBench 为目标化信息检索系统提出了数据集挑战。
查看缓存全文
缓存时间: 2026/04/20 08:30
# UsefulBench:面向决策有用信息的信息检索目标 来源:https://arxiv.org/html/2604.15827 Tobias Schimanski1,2, Stefanie Lewandowski3, Christian Woerle4, Nicola Reichenau3, Yauheni Huryn4, Markus Leippold1,5 1苏黎世大学 2瑞士联邦理工学院 3score4more GmbH 4Climate+Tech Think Tank 5瑞士金融研究所 (SFI) [email protected] ###### 摘要 传统信息检索关注于识别文本与查询的相关性。然而,传统的相关性定义主要由文本相似性决定,忽视了文本是否真正有用于解决查询的问题。例如,在回答"巴黎是否比柏林大"的问题时,关于巴黎在法国的文本是相关的(词汇/语义相似性),但并无实用价值。本文介绍 UsefulBench,这是一个由三位专业分析师标注的领域特定数据集,用于判断文本是否与查询相连(相关性)或是否具有回应查询的实际价值(有用性)。我们证明了经典的基于相似性的信息检索更加符合相关性定义。虽然基于 LLM 的系统可以抵消这种偏差,但我们发现领域特定问题需要高度的专业知识,这是当前 LLM 尚未充分具备的。我们探索了克服这一挑战的方法。然而,UsefulBench 为有针对性的信息检索系统提出了数据集挑战。 ## 1 引言 现代大型语言模型(LLM)在解决编码和数学等广泛任务方面能力日益增强(例如 GPT-5 Team,2025;Yang 等人,2025;Llama3 Team,2024)。将 LLM 用于问答任务通常涉及对幻觉和过时信息的顾虑。为了缓解这些顾虑,许多应用采用检索增强生成(RAG),其中为 LLM 提供外部上下文来回答问题(Lewis 等人,2021)。然而,随着 RAG 的出现,关于其在各种用例中的可靠性的持续辩论也随之开始(Liu 等人,2023;Schimanski 等人,2024a;Xian 等人,2025)。 可靠 RAG 的一个主要瓶颈是检索过程。先前的研究表明,大型上下文可能扭曲问答性能(Liu 等人,2024)。同时,检索过程中排名最高但不包含答案或包含误导证据的文档可能会严重扭曲有效的问答性能(Cuconasu 等人,2024;Xian 等人,2025;Zeng 等人,2026)。这促使我们将文档分为两类:相关和有用。相关文档包含与查询相关的信息(可能有助于为答案提供上下文),而有用文档包含直接信息以回应查询(见图 1)。 **图 1:** 相关性和有用性示例。文档可能高度相关,但在生成答案时并无实用价值。高度相关但无用的文档可能会损害答案质量(例如见 Cuconasu 等人,2024;Xian 等人,2025)。 然而,传统信息检索系统倾向于我们定义的相关性。它们根据词汇或语义相似性对文档进行排名(例如 Robertson 和 Zaragoza,2009;Santhanam 等人,2022),这一点在本文中得到验证(第 4.3 节)。同时,先前的研究表明,先进的基于相似性的嵌入系统因非避免的理论限制而在简单查询上可能失败(Weller 等人,2025)。为了克服其中一些顾虑,先前的研究建议使用基于 LLM 的相关性标注工具(Es 等人,2024;Saad-Falcon 等人,2024),也纳入了相关性的程度(Ni 等人,2025)。然而,据作者所知,还没有项目旨在区分相关和有用的文档。 因此,我们介绍 UsefulBench,一个包含由专业分析师标注的相关性和有用性程度的领域特定数据集。具体而言,我们关注可持续性报告领域,其中查询通常涵盖广泛的相关和决策有用内容。例如,查询"公司的二氧化碳排放量是多少?"可能在可持续性报告中被广泛讨论,通过提及其重要性、公司如何定义这些排放量或其来源的背景信息。然而,只有具体的二氧化碳排放数字才是有用信息(见图 1)。 为了创建 UsefulBench,我们采用专家分析过程,为三位专业可持续性分析师配备真实查询和查询描述。分析师搜索公司的可持续性报告并识别相关和有用的文档。每个识别的文档被标注为非相关、部分相关或完全相关,以及非有用、部分有用或完全有用(见图 2)。结果,我们获得了一个数据集,涵盖 15 份可持续性报告中的 1,110 个标注文档,使用 64 个不同的查询(UsefulBench-gold)。我们还将 UsefulBench-gold 扩展到报告级别数据集,涵盖报告中的所有文档,具有和不具有相关性和有用性,包含 53K 个报告-查询-文档三元组的数据集(UsefulBench-full)。 使用 UsefulBench,我们证明了相关性和有用性在自然上是相连的,正如预期的那样。然而,仍存在明显差异。传统的基于相似性的 IR 系统更符合我们的相关性定义。虽然基于 LLM 的系统可以抵消部分偏差并有效改进有用性检测,但我们观察到早期性能上限。当两位专业分析师调查误分类时,他们发现基于 LLM 的判断并未充分纳入专家知识,可能误解了给定的查询描述。我们进一步表明,在一系列补救方法中——从提供示例、精化查询描述、提示技术到微调——通常只有部分收益,在分类和校准之间权衡。最有前景的方法直接在分类过程中纳入专家知识。然而,这些领域特定查询的准确判断仍然是一个挑战。 总体而言,我们的贡献包括: - • 我们介绍 UsefulBench,一个由三位专业分析师标注的数据集,用于区分文档对查询的相关性和有用性。 - • 我们证明了,虽然相关性和有用性是纠缠的,但存在明显差异,传统 IR 系统更多地符合相关性。 - • 集成专家知识的基于 LLM 的系统可以作为部分补救,但最终因缺乏专家知识而受阻。 **图 2:** UsefulBench 创建流程。三位专业分析师搜索与给定查询和查询描述相关和有用的文档(文本段落)。分析师随后在共识讨论中整合其发现,以确定最终标签。 ## 2 文献背景 **检索和相关性。** 信息检索(IR)传统上关注于识别与查询相关的文档。在经典 IR 中,相关性通过词汇匹配近似(例如在 BM25 中(Robertson 和 Zaragoza,2009))。更新近的神经检索器用语义相似性取代词汇重叠,例如在 DPR(Karpukhin 等人,2020)或 ColBERTv2(Santhanam 等人,2022)中。BEIR 等基准已标准化了词汇和密集检索模型在各个领域的比较(Thakur 等人,2021)。然而,在这些设置中,相关性仍然主要作为主题或语义相关性来操作化,这不保证文档包含回答查询所需的信息。这一局限性随着最近工作表明嵌入基检索对某些查询类型的理论和实证限制而变得更加突出(Weller 等人,2025)。 **RAG 的检索。** 检索增强生成(RAG)的兴起使这一局限性更加重要,因为检索错误直接影响答案生成。先前的工作表明,主题相关但不包含答案的段落可能损害下游性能(Cuconasu 等人,2024;Zeng 等人,2025),而长上下文使语言模型更难识别和使用正确的证据(Liu 等人,2024)。当证据包含矛盾或恶意文档时,也显示了类似的性能下降(Xian 等人,2025;Zeng 等人,2026)。同时,当问答不存在有用证据时,RAG 系统也会受到影响(Peng 等人,2025)。这些挑战在气候和可持续性分析等领域特定设置中特别突出,其中系统必须从长技术报告中检索(Vaghegi 等人,2023;Ni 等人,2023)。 **基于 LLM 的相关性标注。** 相关工作使用 LLM 评估或标注检索质量。RAGAS 和 ARES 为 RAG 管道中的检索和生成组件引入了自动化框架(Es 等人,2024;Saad-Falcon 等人,2024)。同时,先前的工作已勾勒出领域特定检索中的挑战(Ni 等人,2025;Schimanski 等人,2024b)。通常,基于 LLM 的检索系统以更多计算量为代价改进检索质量(Ni 等人,2025;Zhang 等人,2025)。LLM 可以制定更细粒度的相关性定义,这些定义倾向于我们定义的有用性。然而,没有先前的工作采取了对相关和有用文档的主动区分的立场。这种区分在知识密集型领域尤为重要,其中许多段落广泛讨论查询的主题,但只有小部分提供可操作的、决策有用的证据。 ## 3 UsefulBench 该项目旨在在信息检索过程中区分相关性和有用性。由于据作者所知,没有数据集明确区分这两个概念,我们介绍 UsefulBench。 ### 3.1 数据创建 UsefulBench 的核心是传统相关性理解与有用性概念之间的区分。相关性通常通过查询和文档之间的词汇或语义相似性来定义。相比之下,有用性反映了文档中包含的信息是否直接对答案查询或支持决策有贡献。 我们辩称,相关性和有用性之间的区分在需要深层次上下文理解的领域特定设置中变得尤为重要(Szymanski 等人,2025;Ni 等人,2025)。因此,我们专注于可持续性领域。可持续性和气候披露本质上是定性和复杂的。即使是广泛使用的指标(如排放)也可以以多种方式解释。当将查询简化为"公司的二氧化碳排放量是多少?"时,可持续性报告通常包含大量相关的背景信息,例如排放削减战略的描述、方法论说明或气候风险的讨论。虽然这些段落显然是相关的,但只有一小部分文档包含回答查询所需的确切排放数字。因此,相关信息可能掩盖真正有用的信息(另见图 1)。 为了反映真实的专家工作流程,数据集基于专业可持续性分析过程构建。三位专业可持续性分析师使用伴随描述的真实查询(图 5)审查公司的可持续性报告。示例包括有关能源效率、碳足迹或绿色 IT 的信息。总体而言,分析师审查了来自 10 个不同行业的 15 份公司的可持续性报告。每份报告平均用 20.5 个查询进行分析(标准偏差:8)。这遵循一个结构,其中每家公司根据 7 个行业特定查询和最多 14 个行业通用查询进行评估。对于每个查询,分析师阅读整份报告并识别包含潜在相关或决策有用信息的段落。平均而言,每个查询标注 3.3 个文档。 分析师在检索段落时遵循以下定义(分析师将查询称为"标准";详细提示见图 6 和 7): - • (高度)相关性:信息与标准有强有力的直接联系。它包含对标准分析至关重要的特定关键词、概念或主题。内容明确描述了标准或高度相关且切题。 - • (高度)有用性:信息提供了显著的实际价值。它包含清晰的、可操作的洞察、具体数字、具体成就、解决方案或详细计划,可以直接使用。内容为理解公司在标准方面的努力提供了切实的价值。 这些定义反映了本文的核心区分。虽然有用性通常意味着相关性,但反之不一定成立:信息可能高度相关但在回答问题时提供的价值很小。
相似文章
MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
AISE-Bench:面向学术知识图谱信息检索的全流程精选基准
本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。
UserToolBench:工具使用大语言模型中个性化决策的用户画像隐藏基准
UserToolBench 是一个新的基准,用于评估工具使用大语言模型中的个性化决策,测试模型是否能在信息不完整的情况下推断潜在用户偏好、决定何时澄清,并生成与用户一致的工具调用轨迹。实验表明,当前模型在多工具协调和长期一致性方面存在困难。
@_reachsumit: OBLIQ-Bench: 揭示现代检索器中因潜在和隐式查询而被忽视的瓶颈 @dianetc_ 等人提出…
OBLIQ-Bench 是一个新的基准测试,揭示了当前检索系统在处理需要潜在或隐式推理的间接查询时的弱点,表明即使复杂的检索流程也无法提供相关文档,而这些文档是推理型大语言模型容易验证的。