@dianetc_: 我们着手构建一个更好的检索器,因此寻找了最难的IR基准测试。针对每个基准,我们询问了还有多少提升空间……
摘要
作者介绍了OBLIQ-Bench,这是一个新基准,用于评估信息检索系统在明显更难的搜索查询上的表现,而之前的基准测试几乎没有剩余提升空间。
我们着手构建一个更好的检索器,因此寻找了最难的IR基准测试。
针对每个基准,我们通过使用前沿大语言模型进行神谕重排序,询问还有多少提升空间。大多数基准几乎没有剩余空间!
因此我们构建了OBLIQ-Bench,用于研究比以往更难的搜索查询。https://t.co/IIWIbk98nN
查看缓存全文
缓存时间: 2026/05/08 10:48
我们着手构建更好的检索器,因此寻找了最难的IR基准测试。针对每个基准,我们通过使用前沿LLM进行oracle reranking来评估还有多少改进空间。结果发现大部分基准几乎没有剩余空间!因此我们构建了OBLIQ-Bench,以研究比以往更难的搜索查询。https://t.co/IIWIbk98nN
相似文章
@_reachsumit: OBLIQ-Bench: 揭示现代检索器中因潜在和隐式查询而被忽视的瓶颈 @dianetc_ 等人提出…
OBLIQ-Bench 是一个新的基准测试,揭示了当前检索系统在处理需要潜在或隐式推理的间接查询时的弱点,表明即使复杂的检索流程也无法提供相关文档,而这些文档是推理型大语言模型容易验证的。
我在700个查询上对我的基于推理的检索系统与FAISS和BM25进行了基准测试,所有操作均在本地Qwen上运行。结果及不足之处
一个基于推理的检索系统(ClawIndex)在700个查询上与FAISS和BM25进行基准测试,使用本地Qwen,取得了更高的NDCG@10但在某些数据集上速度较慢且MRR较低,作者希望获得反馈。
@__lu__jasper: 在OBLIQ-bench的子采样版本上尝试搜索的一些早期结果。Mixedbread的重排序器是一...
在子采样OBLIQ-bench上测试搜索的早期结果显示,Mixedbread的重排序器获得了较强的MRR,有时在某些指标上优于GPT 5.5,且速度更快,但该基准测试仍具有挑战性。
@bclavie: 这可能是今年最好的IR发布。文本基准测试(过去)已失效,DL19/DL20/BEIR不再提供有价值…
一个新的IR基准发布解决了DL19/DL20/BEIR中文本基准测试失效的问题,使得在当前时代的训练方法中能够有意义地衡量改进。
重新思考推理密集型检索:评估并提升智能体搜索系统中的检索器
本文引入了 BRIGHT-Pro,这是一个针对推理密集型检索的新基准,以及 RTriever-Synth,这是一个用于微调 RTriever-4B 以在智能体搜索系统中提升性能的合成语料库。