BM25 + 向量搜索 + RRF 真的值得吗?
摘要
本文质疑将 BM25 与向量搜索结合 RRF 是否能提高智能体记忆检索的命中率,并暗示仅使用 BM25 可能就足够了。
嘿,智能体构建者们,对于使用 RRF 的 [BM25 + 向量搜索],你们真的在测量命中率吗?对于我摄入的智能体记忆,我看到最相关的命中来自 BM25 排名,向量 + RRF 真的值得吗?
相似文章
@DailyDoseOfDS_: 别再到处用向量搜索了!一个30年前的算法,无需训练、无需嵌入、无需微调……
文章反对过度使用向量搜索,强调BM25在精确关键词匹配上的有效性及其在混合搜索系统中的作用。
@Al_Grigor: 不要默认从一开始就在RAG项目中使用向量搜索。先使用文本搜索。更简单:- 无需嵌入模型 ……
一条实用建议的推文,建议从一开始就用文本搜索(BM25)而不是默认用向量搜索来启动RAG项目,以降低复杂性;只有出现语义差距时才添加向量搜索。
RAG Retrieval Deep Dive: BM25, Embeddings, and the Power of Agentic Search
本文深入对比了BM25词法搜索和嵌入语义搜索在RAG检索中的优缺点,给出了根据查询类型和系统权衡选择检索方法的实用框架,强调了将RAG视为系统而非简单组件的重要性。
当更多文档损害RAG:通过领域限定、模型无关的检索缓解向量搜索稀释
本文识别了RAG系统在扩展到大规模异构文档集合时出现的“向量搜索稀释”现象,并提出MASDR-RAG,一种利用组织元数据进行领域限定的检索方法,显著提升了检索准确率。
介绍上下文检索
Anthropic 推出了上下文检索,这是一种结合了上下文嵌入和 BM25 的技术,通过减少检索失败的情况,显著提高了 RAG 的准确性。