Q2D-Web: 大规模评估第一阶段检索器(阅读时长约11分钟)
摘要
Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,具有1.9亿文档和查询,涵盖十种语言,并采用方法以最小化偏差并降低评估成本。
Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,包含1.9亿文档和69,721个查询,涵盖十种语言。它使用三套独立的相关性判断集来最小化偏差并提高可靠性,帮助检索器区分相关数据与干扰项。评估提交通过子采样方法处理,以减少资源成本,同时保持模型排名的完整性。
相似文章
我在700个查询上对我的基于推理的检索系统与FAISS和BM25进行了基准测试,所有操作均在本地Qwen上运行。结果及不足之处
一个基于推理的检索系统(ClawIndex)在700个查询上与FAISS和BM25进行基准测试,使用本地Qwen,取得了更高的NDCG@10但在某些数据集上速度较慢且MRR较低,作者希望获得反馈。
@dianetc_: 我们着手构建一个更好的检索器,因此寻找了最难的IR基准测试。针对每个基准,我们询问了还有多少提升空间……
作者介绍了OBLIQ-Bench,这是一个新基准,用于评估信息检索系统在明显更难的搜索查询上的表现,而之前的基准测试几乎没有剩余提升空间。
跨数据库查询与网络搜索的混合深度研究基准测试
本文介绍了HybridDeepResearch,一个用于评估AI智能体在需要整合网络搜索和SQL查询任务上的基准测试,揭示了即使最先进的模型在跨结构化和非结构化数据维护约束方面也存在困难。
召回前重排序:大规模代码到代码检索的深度学习模型基准测试
本文对17种深度学习模型在大规模代码到代码检索的第一阶段召回中进行了基准测试,评估了它们在多种编程语言和数据集上的精确度、效率和可扩展性。文中介绍了基于LLM的代码标准化和查询重写方案,这些方案提高了性能较低模型的精确度。
当检索无济于事:一项大规模生物医学 RAG 研究
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。