bm25

标签

Cards List
#bm25

ParadeDB 搜索性能提升

Hacker News Top ↗ · 2天前 缓存

ParadeDB 面对 PlanetScale 新推出的 TIN Postgres 全文搜索扩展,通过多轮优化而非架构调整,将自身 BM25 性能差距缩小至 8 倍以内,并在相同的 StackExchange 数据集上进行基准测试对比。

0 人收藏 0 人点赞
#bm25

PILLAR:面向增强检索的私有倒排索引词法查找

arXiv cs.AI ↗ · 4天前 缓存

PILLAR 介绍了一个基于私有信息检索(PIR)的隐私保护 RAG 系统,通过两阶段私有混合检索(稀疏 BM25 过滤 + 本地稠密重排)在不泄露查询的情况下,实现比现有方案更低的延迟和更高的检索质量。

0 人收藏 0 人点赞
#bm25

从零构建HNSW并对比FAISS基准测试:在5,183篇文档下暴力检索仍然胜出。[P]

Reddit r/MachineLearning ↗ · 2026-08-26

作者从零构建了一个检索引擎,将HNSW与FAISS进行对比基准测试。研究发现,对于小型文档集,暴力搜索速度更快;编码器延迟主导了检索时间;而通过RRF融合BM25与稠密检索能显著提升检索质量。

0 人收藏 0 人点赞
#bm25

RAG 并没有你想象的那么复杂

Hacker News Top ↗ · 2026-08-26 缓存

文章探讨了六种 RAG 架构,并建议根据数据新鲜度、查询模式和规模等因素选择合适的方法,以避免过度工程化。

0 人收藏 0 人点赞
#bm25

@techNmak: 30题详解嵌入、向量搜索与检索的实际工作原理 - 相似度度量、对比学习…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

一个30题详解,阐述嵌入、向量搜索和检索系统的工作原理,涵盖相似度度量、训练方法、索引技术和评估。

0 人收藏 0 人点赞
#bm25

检索失败在哪里?评估农业咨询中的RAG架构

arXiv cs.CL ↗ · 2026-08-18 缓存

本文评估了RAG系统在孟加拉语农业咨询中的检索质量,发现性能因查询类型和语言条件而异,并引入了一个基准数据集,以强调在低资源环境中进行分层评估的必要性。

0 人收藏 0 人点赞
#bm25

@GithubProjects: Tantivy 让你在 Rust 中实现类似 Lucene 的全文搜索,启动时间低于 10 毫秒,非常适合 CLI 工具。BM25 评分…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

Tantivy 是一个基于 Rust 的库,提供类似 Lucene 的全文搜索,启动时间低于 10 毫秒,并具备快速索引能力,非常适合 CLI 工具。

0 人收藏 0 人点赞
#bm25

用于资源匮乏的东北印度语言的BM25增强多示例翻译

arXiv cs.CL ↗ · 2026-08-17 缓存

本文提出了一种使用BM25和Gemini 2.5 Flash的检索增强翻译系统,针对资源匮乏的东北印度语言,提交至WMT26共享任务,无需模型微调。

0 人收藏 0 人点赞
#bm25

BM25在大规模下胜出:检索增强生成范式的规模扩展研究

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

一项对检索增强生成范式的受控扩展研究发现,BM25词汇检索在大规模下优于智能体检索和图检索,而智能体搜索仅在小型语料库上领先。

0 人收藏 0 人点赞
#bm25

@shivam74689: 第62天 — 成为AI工程师 今天我开始构建一个企业知识图谱智能RAG系统,并意识到…

X AI KOLs Timeline ↗ · 2026-07-28 缓存

作者描述了构建企业知识图谱智能RAG系统的历程,结合了语义检索、BM25词汇搜索和知识图谱遍历,强调生产级AI需要多种检索策略。

0 人收藏 0 人点赞
#bm25

@alex_prompter: 我的智能体每次我给它们更多工具时,它们都变得更笨了。原因是机械性的。你连接的每个 MCP 服务器…

X AI KOLs Timeline ↗ · 2026-07-21 缓存

Ratel 是一个开源工具,通过使用 BM25 索引仅加载所需的工具(而不是所有可用工具),将输入令牌减少 79%,并提高了 AI 智能体的工具选择准确性。

0 人收藏 0 人点赞
#bm25

AutoIndex:面向检索的表示程序学习

Hugging Face Daily Papers ↗ · 2026-07-21 缓存

AutoIndex是一个框架,学习可执行的表示程序,在索引前转换文档,相比静态BM25基线,平均提升Recall@100达8.4%,nDCG@10达8.3%。

0 人收藏 0 人点赞
#bm25

我在700个查询上对我的基于推理的检索系统与FAISS和BM25进行了基准测试,所有操作均在本地Qwen上运行。结果及不足之处

Reddit r/AI_Agents ↗ · 2026-07-09

一个基于推理的检索系统(ClawIndex)在700个查询上与FAISS和BM25进行基准测试,使用本地Qwen,取得了更高的NDCG@10但在某些数据集上速度较慢且MRR较低,作者希望获得反馈。

0 人收藏 0 人点赞
#bm25

@johnsonshi86: https://x.com/johnsonshi86/status/2072112215097024961

X AI KOLs Timeline ↗ · 2026-07-01 缓存

描述了一种名为DR-DCI的优化方法,它将RAG与虚拟文件系统上的bash命令相结合,使代理能够进行精确的语料库检索,并讨论了为推理提供者扩展到分布式系统。

0 人收藏 0 人点赞
#bm25

Lume工作原理:检索原语

Hacker News Top ↗ · 2026-06-20 缓存

深入技术探讨Lume,一个Rust混合搜索引擎,结合BM25、稠密向量和实体图,实现可审计的本地优先检索。

0 人收藏 0 人点赞
#bm25

当规则学习:一种用于法律案例检索的自我进化智能体

arXiv cs.AI ↗ · 2026-06-17 缓存

本文介绍了一种自我进化框架,该框架利用基于LLM的智能体,为法律案例检索中的BM25迭代创建并优化查询重写规则,在无需任何参数训练的情况下,在LeCaRD-v2基准上优于非进化基线。

0 人收藏 0 人点赞
#bm25

混合检索 + 依赖图扩展优于仅嵌入的代码 RAG——可测量、CI 门控

Reddit r/AI_Agents ↗ · 2026-06-16

Archex 是一款新的开源代码 RAG 工具,通过结合混合搜索(BM25F + 密集嵌入)、交叉编码器重排序和依赖图扩展来改进检索,与纯基于嵌入的方法相比,实现了更高的召回率和令牌效率。

0 人收藏 0 人点赞
#bm25

为什么我停止使用语义嵌入进行工具选择并切换回BM25 [D]

Reddit r/MachineLearning ↗ · 2026-06-08

作者分享了他们在agent中从语义嵌入切换到BM25进行工具选择的经验,发现在200个查询-工具对的数据集上,BM25的Top-1准确率达到81%,而嵌入只有64%,因为工具描述简短且关键词驱动,不像文档那样语义丰富。

0 人收藏 0 人点赞
#bm25

你的RAG应用出问题不是因为模型

Reddit r/ArtificialInteligence ↗ · 2026-06-08

一位开发者分享说,RAG应用中的真正问题是检索步骤在处理版本号和代码时失败,通过混合搜索(向量+BM25+倒数排名融合)解决,而不是模型问题。

0 人收藏 0 人点赞
#bm25

面向智能体搜索的交互空间检索

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

RISE 框架通过结合 BM25 检索与预处理文档索引,为智能体搜索构建有界交互空间,在保持高准确率的同时实现大规模语料库的高效探索。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈