我制作了一个小工具,用于在将检索结果输入RAG之前进行检查

Reddit r/LocalLLaMA 工具

摘要

一位开发者创建了一个小型本地工具,用于在将检索结果输入RAG流水线之前,检查来自Brave、Serper、Tavily和Exa等搜索提供商的检索结果,并关注源多样性、重复性、时效性以及SEO/GEO污染风险等信号。

我一直在尝试RAG的实时网页检索,而一直让我烦恼的部分并不是搜索调用本身,而是判断返回的结果是否真的能用作证据。一个结果可能看起来相关,但仍然可能过时、重复、过度SEO优化,或者根本不足以放入上下文窗口。所以我整理了一个小型本地工具,用于在将检索/搜索结果输入RAG流水线之前进行检查:[https://github.com/mameirolabs/rag-search-quality-lab-public](https://github.com/mameirolabs/rag-search-quality-lab-public) 目前它支持mock、Brave、Serper、Tavily和Exa。它关注一些粗略的信号,如源多样性、重复性、时效性、引用就绪度、SEO/GEO污染风险以及提供商差异。我并不是想做一个基准测试或宣布哪个提供商“最好”。评分仍然非常粗略。我主要用它来并排比较输出,并在证据到达模型之前发现不良证据。很好奇其他人是如何处理这个问题的:在RAG流水线中信任检索到的网页结果之前,你会检查哪些信号?
查看原文

相似文章