bm25

标签

Cards List
#bm25

@shivam74689: 第62天 — 成为AI工程师 今天我开始构建一个企业知识图谱智能RAG系统,并意识到…

X AI KOLs Timeline · 8小时前 缓存

作者描述了构建企业知识图谱智能RAG系统的历程,结合了语义检索、BM25词汇搜索和知识图谱遍历,强调生产级AI需要多种检索策略。

0 人收藏 0 人点赞
#bm25

@alex_prompter: 我的智能体每次我给它们更多工具时,它们都变得更笨了。原因是机械性的。你连接的每个 MCP 服务器…

X AI KOLs Timeline · 2026-07-21 缓存

Ratel 是一个开源工具,通过使用 BM25 索引仅加载所需的工具(而不是所有可用工具),将输入令牌减少 79%,并提高了 AI 智能体的工具选择准确性。

0 人收藏 0 人点赞
#bm25

AutoIndex:面向检索的表示程序学习

Hugging Face Daily Papers · 2026-07-21 缓存

AutoIndex是一个框架,学习可执行的表示程序,在索引前转换文档,相比静态BM25基线,平均提升Recall@100达8.4%,nDCG@10达8.3%。

0 人收藏 0 人点赞
#bm25

我在700个查询上对我的基于推理的检索系统与FAISS和BM25进行了基准测试,所有操作均在本地Qwen上运行。结果及不足之处

Reddit r/AI_Agents · 2026-07-09

一个基于推理的检索系统(ClawIndex)在700个查询上与FAISS和BM25进行基准测试,使用本地Qwen,取得了更高的NDCG@10但在某些数据集上速度较慢且MRR较低,作者希望获得反馈。

0 人收藏 0 人点赞
#bm25

@johnsonshi86: https://x.com/johnsonshi86/status/2072112215097024961

X AI KOLs Timeline · 2026-07-01 缓存

描述了一种名为DR-DCI的优化方法,它将RAG与虚拟文件系统上的bash命令相结合,使代理能够进行精确的语料库检索,并讨论了为推理提供者扩展到分布式系统。

0 人收藏 0 人点赞
#bm25

Lume工作原理:检索原语

Hacker News Top · 2026-06-20 缓存

深入技术探讨Lume,一个Rust混合搜索引擎,结合BM25、稠密向量和实体图,实现可审计的本地优先检索。

0 人收藏 0 人点赞
#bm25

当规则学习:一种用于法律案例检索的自我进化智能体

arXiv cs.AI · 2026-06-17 缓存

本文介绍了一种自我进化框架,该框架利用基于LLM的智能体,为法律案例检索中的BM25迭代创建并优化查询重写规则,在无需任何参数训练的情况下,在LeCaRD-v2基准上优于非进化基线。

0 人收藏 0 人点赞
#bm25

混合检索 + 依赖图扩展优于仅嵌入的代码 RAG——可测量、CI 门控

Reddit r/AI_Agents · 2026-06-16

Archex 是一款新的开源代码 RAG 工具,通过结合混合搜索(BM25F + 密集嵌入)、交叉编码器重排序和依赖图扩展来改进检索,与纯基于嵌入的方法相比,实现了更高的召回率和令牌效率。

0 人收藏 0 人点赞
#bm25

为什么我停止使用语义嵌入进行工具选择并切换回BM25 [D]

Reddit r/MachineLearning · 2026-06-08

作者分享了他们在agent中从语义嵌入切换到BM25进行工具选择的经验,发现在200个查询-工具对的数据集上,BM25的Top-1准确率达到81%,而嵌入只有64%,因为工具描述简短且关键词驱动,不像文档那样语义丰富。

0 人收藏 0 人点赞
#bm25

你的RAG应用出问题不是因为模型

Reddit r/ArtificialInteligence · 2026-06-08

一位开发者分享说,RAG应用中的真正问题是检索步骤在处理版本号和代码时失败,通过混合搜索(向量+BM25+倒数排名融合)解决,而不是模型问题。

0 人收藏 0 人点赞
#bm25

面向智能体搜索的交互空间检索

Hugging Face Daily Papers · 2026-06-05 缓存

RISE 框架通过结合 BM25 检索与预处理文档索引,为智能体搜索构建有界交互空间,在保持高准确率的同时实现大规模语料库的高效探索。

0 人收藏 0 人点赞
#bm25

无需训练的词汇-密集融合用于会话记忆检索

arXiv cs.LG · 2026-06-04 缓存

本文提出了一种无需训练、仅使用CPU的检索方法,该方法将BM25词汇分数与后期交互密集分数相融合,用于会话记忆检索,在六个编码器上相比仅使用后期交互,在LoCoMo Hit@1上提升了高达+17.2个点。该研究提供了关于池化操作符、重排序器效果和基准鲁棒性的受控消融实验,将这种提升视为密集信号与词汇信号之间的分工。

0 人收藏 0 人点赞
#bm25

BM25 + 向量搜索 + RRF 真的值得吗?

Reddit r/AI_Agents · 2026-06-03

本文质疑将 BM25 与向量搜索结合 RRF 是否能提高智能体记忆检索的命中率,并暗示仅使用 BM25 可能就足够了。

0 人收藏 0 人点赞
#bm25

@mixedbreadai:到如今,所有人都知道单向量嵌入模型对现代工作流极为有限。但它们包含更多…

X AI KOLs Following · 2026-06-02 缓存

单向量嵌入模型可用于提取稀疏潜在术语,而BM25可将这一词汇转化为强大的检索器。

0 人收藏 0 人点赞
#bm25

花了太长时间调试RAG,后来才意识到分块一直是问题所在

Reddit r/ArtificialInteligence · 2026-06-01

一位开发者回顾调试RAG系统的经历,发现固定大小分块会破坏句子边界,向量搜索无法处理精确标识符(用BM25解决),以及过时索引导致自信的错误答案。

0 人收藏 0 人点赞
#bm25

@bclavie: 非常兴奋终于能分享这个,已经藏着太久了!现在它非常应景。博客文章很快就会…

X AI KOLs Timeline · 2026-05-30 缓存

研究人员使用经过重构训练的稀疏自编码器,从冻结的密集检索器中提取出可索引且适用于BM25的稀疏特征。

0 人收藏 0 人点赞
#bm25

@_reachsumit: Latent Terms: 密集检索器包含可轻松提取的BM25就绪齐普夫词汇表 @bclavie 等人提取中…

X AI KOLs Following · 2026-05-29 缓存

该论文提出 Latent Terms 方法,使用稀疏自编码器从冻结的密集检索器中提取BM25就绪的稀疏特征,无需检索特定训练即可实现有竞争力的性能。

0 人收藏 0 人点赞
#bm25

@jerryjliu0:真正的问题是:文件搜索和检索的最新实际技术水平是什么?- 在文件系统上实际使用 grep…

X AI KOLs Following · 2026-05-18 缓存

Jerry Liu 询问文件搜索和检索的当前最先进技术,列出了从 grep 到数据库上的混合搜索等选项。

0 人收藏 0 人点赞
#bm25

@rwayne: Context Mode 解决了 AI Agent 的另一半上下文问题:工具输出沙箱化 + 会话持久化。 56 KB 的 Playwright 快照压缩到 299 字节,98% 的数据不进上下文。每次文件编辑、Git 操作、任务决策都存入…

X AI KOLs Timeline · 2026-05-12 缓存

Context Mode is a tool that solves AI agent context problems by sandboxing tool outputs and persisting sessions, achieving up to 98% compression of Playwright snapshots and using BM25 retrieval to reduce context window usage. It supports 15 platforms including Claude Code, Gemini CLI, VS Code Copilot, and is used by major tech companies.

0 人收藏 0 人点赞
#bm25

重新思考基于 Pi-Serini 的智能体搜索:词法检索是否足够?

Hugging Face Daily Papers · 2026-05-11 缓存

本文介绍了 Pi-Serini,这是一个基于 BM25 的智能体搜索系统。该系统证明了当智能体优化查询时,词法检索足以支持深度搜索,相比默认设置,它在实现高准确率的同时降低了成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈