Q2D-Web: 大规模评估第一阶段检索器(阅读时长约11分钟)

TLDR AI 工具

摘要

Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,具有1.9亿文档和查询,涵盖十种语言,并采用方法以最小化偏差并降低评估成本。

Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,包含1.9亿文档和69,721个查询,涵盖十种语言。它使用三套独立的相关性判断集来最小化偏差并提高可靠性,帮助检索器区分相关数据与干扰项。评估提交通过子采样方法处理,以减少资源成本,同时保持模型排名的完整性。
查看原文

相似文章

召回前重排序:大规模代码到代码检索的深度学习模型基准测试

arXiv cs.CL

本文对17种深度学习模型在大规模代码到代码检索的第一阶段召回中进行了基准测试,评估了它们在多种编程语言和数据集上的精确度、效率和可扩展性。文中介绍了基于LLM的代码标准化和查询重写方案,这些方案提高了性能较低模型的精确度。

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。