标签
Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,具有1.9亿文档和查询,涵盖十种语言,并采用方法以最小化偏差并降低评估成本。
介绍了 Agent Retrieval Bench,这是一个文件级基准测试,用于评估编码智能体在上下文获取阶段检索相关仓库文件的能力。该基准测试包含来自25个仓库的427个样本,评估了多种检索方法,发现没有任何单一方法类别占据主导地位。
OBLIQ-Bench 引入了一套包含五项倾斜搜索任务的套件,揭示了检索与验证之间的差距:推理型大语言模型在文档被呈现出来后能轻松识别相关文档,但即便是最先进的检索器也无法将其呈现出来,凸显了现代检索系统中被忽视的瓶颈。