@_reachsumit: OBLIQ-Bench: 揭示现代检索器中因潜在和隐式查询而被忽视的瓶颈 @dianetc_ 等人提出…
摘要
OBLIQ-Bench 是一个新的基准测试,揭示了当前检索系统在处理需要潜在或隐式推理的间接查询时的弱点,表明即使复杂的检索流程也无法提供相关文档,而这些文档是推理型大语言模型容易验证的。
查看缓存全文
缓存时间: 2026/05/08 17:36
OBLIQ-Bench:揭示现代检索器中潜伏与隐式查询的忽视瓶颈 @dianetc_等人提出了一种“旁敲侧击“型查询的基准(匹配隐含立场或抽象推理等模式)。https://arxiv.org/abs/2605.06235 https://huggingface.co/datasets/dianetc/OBLIQ-Bench… — # OBLIQ-Bench:揭示现代检索器中潜伏与隐式查询的忽视瓶颈 来源:https://arxiv.org/html/2605.06235 Diane Tchuindjo Devavrat Shah Omar Khattab 麻省理工学院,剑桥,马萨诸塞州 {dianetc, devavrat, okhattab}@mit.edu ###### 摘要 检索基准日益饱和,但我们认为高效搜索远未解决。我们识别出一类称为旁敲侧击的查询,它们寻找具现隐式模式的文档,比如寻找表达隐含立场的推文、展示特定失败模式的聊天记录,或匹配抽象场景的转录文本。我们研究了旁敲侧击可能产生的三种机制,并引入了 OBLIQ-Bench,这是一套基于真实长尾语料库的五项旁敲侧击搜索问题。OBLIQ-Bench 揭示了检索与验证之间被忽视的不对称性:当相关文档被提供时,推理型 LLM 能可靠地识别潜在相关性,但即便最复杂的检索管道也往往无法首先将这些相关文档筛选出来。我们希望 OBLIQ-Bench 能推动研究更高效捕捉大型语料库中隐式模式和隐式信号的检索架构。111数据:https://huggingface.co/datasets/dianetc/OBLIQ-Bench 参见图注图1:与之前的基准相比,OBLIQ-Bench 中的相关文档易于识别但远难检索。图中每个点代表一个检索基准。y 轴显示一套最先进的检索系统和基于智能体的多跳搜索管道所取得的最佳 NDCG@10。x 轴显示当推理模型对混入了黄金结果、包含大量硬负例的候选集进行重排序时所取得的 NDCG@10。之前的基准大多位于对角线附近:强大的检索器能恢复大部分推理模型可验证的内容。相比之下,旁敲侧击任务落在右下角:推理模型能识别相关文档,但即便由 LLM 驱动的检索系统也无法将其筛选出来。更多细节见第3节 (https://arxiv.org/html/2605.06235#S3) 和第5节 (https://arxiv.org/html/2605.06235#S5)。## 1 引言 现代信息检索(IR)基准日益将现有 IR 范式描绘为高度有效且几乎难以区分。在诸如 MS MARCO (Bajaj 等人,2016 (https://arxiv.org/html/2605.06235#bib.bib3))、BEIR (Thakur 等人,2021 (https://arxiv.org/html/2605.06235#bib.bib36))、MTEB (Muennighoff 等人,2023 (https://arxiv.org/html/2605.06235#bib.bib25)) 乃至 BRIGHT (Su 等人,2025 (https://arxiv.org/html/2605.06235#bib.bib32)) 等标准段落排序数据集上,饱和迹象普遍存在,且越来越难以观察到强大的密集检索器 (Karpukhin 等人,2020 (https://arxiv.org/html/2605.06235#bib.bib16);Qu 等人,2021 (https://arxiv.org/html/2605.06235#bib.bib26))、后期交互模型 (Khattab 和 Zaharia,2020 (https://arxiv.org/html/2605.06235#bib.bib17)) 以及基于 LLM 的多跳智能体 (Yao 等人,2023 (https://arxiv.org/html/2605.06235#bib.bib43);Chang 等人,2026 (https://arxiv.org/html/2605.06235#bib.bib8)) 在 NDCG@k 等指标上的显著差异。参见图注图2:我们的五个 OBLIQ-Bench 任务涵盖三种类型的旁敲侧击搜索查询。描述性查询寻找可从文档内容推断出的隐式属性,例如微妙暗示某一详细立场的推文,以及表现出隐式失败模式的人机对话。类比性查询寻找与查询内容共享同一原型但表面主题不同的所有文档,例如可采用相同证明技术的数学问题,或跨主题共享作者风格印迹的文本片段。最后,舌尖型查询将模糊回忆与某一具体晦涩段落进行匹配,例如国会听证会的转录文本。在每个任务中,相关性均可由推理模型验证,但当前检索系统难以应对。事实上,在众多现有 IR 基准(图1;右上角)中,那些可由推理模型验证其相关性的文档,在很大程度上已能被高效搜索算法轻松检索。如果可扩展的检索器几乎能匹配由昂贵的前沿 LLM(能同时阅读查询和文档)所设的上限,那么还有什么问题亟待解决?我们认为,这种表面饱和是现有基准的人为产物,而非检索问题本身的属性。存在一些自然查询——真实用户可能提出、有雄心的下游系统应支持的查询——当前检索架构在这些查询上得分极低,而推理型 LLM 得分却显著更高(图1;右下角)。这些查询共享一个我们称为旁敲侧击的非正式属性:决定相关性的属性是隐式的,在文档中几乎没有直接文字表达。想象一位分析师在推文语料库中搜索所有讽刺用户将远方武装冲突娱乐化的帖子,但该帖子本身并未明确表达此意。相关推文可能通过反讽或选择强调的内容来传达其立场,但通常不会与查询直接重叠。或者一位审计员搜索人机对话,寻找模型收到格式约束,若干轮后违反该约束并从未自行纠正的案例。该失败在转录文本中显而易见,但在对话中可能并未作为一个主题被提及。又或者,一位试图净化训练数据的 ML 专家可能希望找到所有与给定问题使用相同证明策略的问题,尽管细节不同。为了推动该领域应对这些具有挑战性的检索难题,我们做出了三项贡献。首先,我们将旁敲侧击型检索识别为评估搜索系统中一个被忽视的范畴。我们将检索失败与验证成功之间的差距,即检索-验证不对称性(第3节),形式化为旁敲侧击的实证测试,并用它来表明现有基准通常无法通过测试:它们相对于现有方法并非旁敲侧击型(图1)。其次,我们开发了 OBLIQ-Bench(第4节),在五个长尾语料库之上引入了五个困难的检索任务(图2)。为了在不穷尽评判每个查询-文档对的情况下,在大型语料库上获得高召回的相关性判断,我们提出了一种管道:从人类定义的阅读语料库的视角出发(例如推文中隐式立场或对话中失败模式),允许推理型 LLM (1) 在可承受的单次遍历中标注整个语料库,(2) 使用这些提取的隐式属性标注对文档进行聚类,以及 (3) 生成描述每个聚类的、范围定义良好的查询。图2展示了我们能以这种方式生成的代表性示例查询及其相关性判断。最后,我们在五个任务上评估了词汇、密集、后期交互和基于智能体的检索器(第5节),得出了关于现有 IR 格局的五条教训。所有系统在每个任务上得分都很低,常接近 NDCG@10 为零。相比之下,应用锦标赛式重排序于一个包含大量硬负例的大型候选集(图3)的推理模型,其性能随候选集规模显著提高,并能可靠分离相关文档,这验证了相关性信号的存在,但对于当前不采用查询与文档联合推理的方法而言难以获取。我们发布了所有语料库、查询和相关性判断,期望 OBLIQ-Bench 能推动研究新的可扩展检索方法,以应对这类旁敲侧击型查询。## 2 背景与相关工作 我们关注在大型语料库 C={d1,…,dN} 上可扩展的检索。在查询时,检索器接收一个查询 q 和一个整数 k≪N,必须返回排序后的列表 di1,…,dik。检索器可在离线阶段进行大量工作,例如预计算表示或构建索引,但其每次查询的成本应随语料库大小呈次线性增长,例如总操作数 O(N0.5),其中最多 O(1) 次调用大型 LLM,或者其常数应足够小,使得在大型 C 上进行查询成为可能。现代检索范式符合这一设定,不仅包括词汇、密集检索器和后期交互方法,也包括高度复杂的 LLM 搜索智能体或查询重写管道。我们使用标准 IR 指标如 NDCG@k 和 Recall@k 来评估质量。OBLIQ-Bench 聚焦于相关性由隐式关系决定的查询。旁敲侧击型描述性查询寻找隐式表达隐式属性的文档,例如隐含立场或行为失败模式。旁敲侧击型类比性查询寻找与查询共享抽象结构的文档,例如证明策略或作者风格,而表面主题不同。最后,旁敲侧击型舌尖查询基于部分、有损且抽象的回忆寻找晦涩段落。这些机制涉及之前的多条研究路线,但在 OBLIQ-Bench 中,瓶颈出现在搜索过程非常早期的阶段。例如,现有的基于描述的检索查询 (Ravfogel 等人,2024 (https://arxiv.org/html/2605.06235#bib.bib27)) 搜索与其内容抽象描述匹配的句子,例如匹配“职业转型”与“转向管理职业”,这是一个较浅的语言视角。现有的舌尖型和推断型查询通常寻找流行实体,如电影、书籍或名人 (Arguello 等人,2021 (https://arxiv.org/html/2605.06235#bib.bib2);Lin 等人,2023 (https://arxiv.org/html/2605.06235#bib.bib20);Mozafari 等人,2026 (https://arxiv.org/html/2605.06235#bib.bib24)),例如匹配“持有最多冠军头衔的西班牙语足球运动员”至关于 Lionel Messi 的段落,这越来越容易通过 LLM 参数知识进行查询重写来破解。最后,强推理类检索如 BRIGHT 寻找那些可能难以验证但并非系统地更难以进入 top-k 候选集的证据文档。OBLIQ-Bench 旨在将隐式相关性本身变成首阶段搜索的瓶颈,从而将困难提前(首先在于可扩展地筛选出这些文档),从而激发了下面的检索-验证诊断。附录 A 包含扩展的相关工作部分。## 3 旁敲侧击与检索-验证不对称性 我们旨在向检索器提出比当前流行基准更具挑战性的难题。为此,我们必须避免那些看似困难但仅仅因为查询表述不当或无法取得高分的任务。换句话说,我们必须找到任务 t,使得对于一组感兴趣的、可扩展的检索系统集 R,检索-验证差距很大。我们如下定义该差距。对于质量指标 Q,设 gap(t) = Vt - Rt,其中 Vt = max_{m∈M} Q(m,t) 代表在强大的模型类 M 中任何模型 m 所能达到的最佳质量,此类模型通常成本极高;而 Rt = max_{r∈R} Q(r,t) 是高效检索系统类中得分最高的 r 的质量。虽然对语料库 C 中的每个文档运行 M 中的强大模型 m 一次或两次可能是可承受的(第4节),但我们不能为每个查询 q 都穷举重复此过程。相反,我们可以让某个高效系统 r∈R 获取一个集合 K≫k 的文档,然后使用强大模型 m∈M 对这些未排序的 K 个文档进行排序。22这受 TREC 用于评估检索器的标准方法 pooling (Voorhees, 2007) 的启发,其中“评判者仅审查每个检索系统针对该主题返回的前 X 个检索结果的并集文档”。这样做确立了最佳可能系统 Q(⋆,t) 质量的下界。在关于 m 稳定性的适度假设下,我们可以通过确保对于一个查询 q,每个缺失的“黄金”文档都被注入到 r 获取的 K 个文档中(混洗后的结果),进一步逼近该两阶段 ⟨r,m⟩ 系统质量的上界。参见图注 (a) Twitter 冲突 参见图注 (b) Math Meta Program 参见图注 (c) 国会听证会 图3:检索-验证差距随着硬候选集规模增长而持续存在。最先进的密集检索器 Gemini-2-Embedding 和 GPT-5.2 重排序器在候选集规模 K 增加时的 Recall@10 表现。对于每个模型,虚线曲线直接对检索到的候选集进行排序,给出了依赖底层候选集召回率的下界估计。实线曲线在排序前将缺失的黄金文档注入候选集,给出了模型在文档出现后识别正例能力的上界估计。垂直线之后微弱和虚线的 GPT-5.2 段是超出最大重排序候选集规模的投影。在所有三个任务中,GPT-5.2 重排序均远高于 Gemini-2-Embedding 相似度,无论在上界还是下界设定下均如此。利用这两个界,我们可以开始估计任务 t 相对于一组最先进的可扩展检索系统 R 的检索-验证差距。为了使这种估计更可靠,我们可以监测这两个界如何随 K 的扩展而移动,并观察一个强大模型 m∈M 的这种移动如何与检索器 r∈R 在相同质量指标 Q 上的移动不同。图3展示了这一模式:强大推理模型 m 设置为 GPT-5.2,而实验中我们认为最强的前沿密集检索器是 Gemini-2-Embedding。我们列表式 GPT-5.2 锦标赛重排序器及其他方法的细节将在第5节讨论。这里,我们在三个代表性 OBLIQ-Bench 任务上运行候选集扩展实验:Twitter 冲突(描述型任务)、Math Meta Program(类比型任务)和国会听证会(舌尖型任务)。对于每个任务和两种方法中的每一种,我们评估两种设定下的 Recall@10 随候选集预算增加的变化:标准设定和黄金注入设定。33 GPT-5.2 评估基于由 BM25、Qwen3-Embedding-0.6B 和 Qwen3-Embedding-4B 的 top-k′ 输出构成的并集候选集。Gemini 嵌入模型在同等规模候选集上测试,但其自身 top-k 不包含在内,因为那会向其呈现自身最难的负例并降低其得分。只有国会任务中 GPT-5.2 的上界线和下界线之间存在较大距离:由于只有一个
相似文章
@dianetc_: 我们着手构建一个更好的检索器,因此寻找了最难的IR基准测试。针对每个基准,我们询问了还有多少提升空间……
作者介绍了OBLIQ-Bench,这是一个新基准,用于评估信息检索系统在明显更难的搜索查询上的表现,而之前的基准测试几乎没有剩余提升空间。
QO-Bench:诊断类型化事件元组上的查询算子保留检索
QO-Bench 是一个针对类型化事件元组上查询算子问答的诊断性基准测试,涵盖 22,984 篇新闻文章和 614 个企业事件,涉及 18 种查询模板。该基准对 RAG、ReAct RAG、GraphRAG 以及抽取转 SQL 系统进行评估,发现算子执行——而非仅仅是检索——才是核心瓶颈,单纯使用更强的模型并不能解决这一问题。
A2RBench:一种自动化的可形式化验证抽象推理基准生成范式
本文介绍了A2RBench,一个用于为LLM生成可形式化验证的抽象推理基准的自动化流水线,它利用循环一致性来确保唯一解,并揭示当前LLM在3D推理任务上显著落后于人类。
@lateinteraction: 目前,我认为极少数长上下文基准测试中值得重视的两个是 OBLIQ-Bench…
一位评论者指出,OBLIQ-Bench(recall@k)和 StudyBench(expertise)是少数可靠的长上下文基准测试中的两个。
UsefulBench:以决策有用信息为目标的信息检索
UsefulBench 引入了一个领域特定的基准数据集,用于区分信息检索中的文档相关性和有用性,表明基于相似度的信息检索系统混淆了这两个概念,而大语言模型可以解决这个问题但缺乏领域专业知识。