QontoFAQ: 一个更优的信息检索基准 [R]
摘要
QontoFAQ 介绍了一个用于信息检索的新基准和指标,专注于提升回答产品问题的相关性度量,并发布了相关的代码和数据集。
信息检索基准有时感觉被模型过度利用,因此我们想找到一种方法,使其尽可能贴近我的目标:找到正确回答产品问题的文章。我们开发了一个新指标,似乎与文档相关性成比例更合适,并构建了一个基准数据集来评估嵌入模型。这是一篇关于该方法的文章:https://medium.com/qonto-way/qontofaq-benchmarking-information-retrieval-acd89600ebe1 以及相关的代码:https://github.com/qonto/qonto-faq-benchmark
相似文章
我在700个查询上对我的基于推理的检索系统与FAISS和BM25进行了基准测试,所有操作均在本地Qwen上运行。结果及不足之处
一个基于推理的检索系统(ClawIndex)在700个查询上与FAISS和BM25进行基准测试,使用本地Qwen,取得了更高的NDCG@10但在某些数据集上速度较慢且MRR较低,作者希望获得反馈。
@dianetc_: 我们着手构建一个更好的检索器,因此寻找了最难的IR基准测试。针对每个基准,我们询问了还有多少提升空间……
作者介绍了OBLIQ-Bench,这是一个新基准,用于评估信息检索系统在明显更难的搜索查询上的表现,而之前的基准测试几乎没有剩余提升空间。
RAGless:基于分数聚合的Q-Q检索,用于封闭域FAQ [P]
RAGless 是一种语义检索系统,它将用户问题与预生成的问题变体进行匹配,适用于封闭域 FAQ,省去了标准 RAG 中的 LLM 生成步骤,从而提高了精确度。
Q2D-Web: 大规模评估第一阶段检索器(阅读时长约11分钟)
Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,具有1.9亿文档和查询,涵盖十种语言,并采用方法以最小化偏差并降低评估成本。
FinFIRST: 金融信息检索、来源与可追溯性搜索代理基准测试
FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。