@HowToPrompt__:整个向量数据库行业被一个1974年的免费工具打败了。过去两年里,每一家公司……

X AI KOLs Timeline 论文

摘要

研究人员报告称,经典的grep命令在自主AI代理的检索任务中胜过现代向量数据库,挑战了当前主流的RAG基础设施方法。

整个向量数据库行业被一个1974年的免费工具打败了。 过去两年里,每一家开发AI的公司都痴迷于“RAG”(检索增强生成)。 他们花费数百万美元在复杂的向量数据库、语义搜索和嵌入模型上。 承诺是什么?这是赋予AI长期记忆的唯一方式。 但研究人员发表了一篇论文,证明最复杂的AI代理实际上用grep表现更好。 没错。就是那个52年前发明的简单搜索命令。 研究人员在复杂的检索任务上测试了现代AI代理框架,包括Claude Code和Gemini CLI。 他们比较了昂贵的向量检索与简单老派的grep搜索。 这对AI基础设施行业来说结果令人难堪。 整体来看,grep不仅与向量数据库竞争。 它击败了它们。它持续获得更高的准确率。 为什么? 向量搜索试图“聪明”。它找到语义相似的文档。 但当自主AI代理搜索精确的代码变量、特定的日志错误或明确的名称时,“相似”是不够的。 “相似”引入了噪声。“相似”分散代理的注意力。 grep是笨的、字面的且完全精确。它正好找到代理所请求的内容。 事实证明,当你将一个超智能推理模型与一个完全字面的搜索工具结合时,结果是爆炸性的。 AI已经拥有语义智能。它不需要数据库替它思考。 它只需要数据库来获取。 当研究人员故意在上下文中添加干扰性的无关文本时,向量搜索崩溃了。它抓取了错误的信息。 grep忽略了噪声,拉取了精确的字符串。
查看原文
查看缓存全文

缓存时间: 2026/06/17 09:53

整个向量数据库行业被一个1974年的免费工具摧毁了。

过去两年里,所有构建AI的公司都痴迷于“RAG”(检索增强生成)。

他们花费数百万美元在复杂的向量数据库、语义搜索和嵌入模型上。

承诺是什么?这是给AI长期记忆的唯一方法。

但研究人员发表了一篇论文,证明最先进的AI代理其实用grep表现更好。

没错。就是那个52年前发明的简单搜索命令。

研究人员测试了现代AI代理工具集,包括Claude Code和Gemini CLI,在复杂的检索任务上。

他们对比了昂贵的向量检索和简单老式的grep搜索。

结果对AI基础设施行业来说很尴尬。

总体上,grep不仅与向量数据库竞争。

它还赢了。它始终提供更高的准确率。

为什么?

向量搜索试图“聪明”。它找到语义相似的文档。

但当一个自主AI代理在搜索确切的代码变量、特定的日志错误或明确的名字时,“相似”还不够好。

“相似”会引入噪音。“相似”会分散代理的注意力。

grep很笨,字面化,且完全精确。它精确地找到代理要求的东西。

事实证明,当把超智能的推理模型与完全字面化的搜索工具结合时,结果爆炸性增长。

AI已经有了语义智能。它不需要数据库替它思考。

它只需要数据库来获取数据。

当研究人员有意在上下文中加入分散注意力的无关文本时,向量搜索崩溃了。它抓取了错误的信息。

grep忽略了噪音,直接拉取了精确的字符串。

相似文章

@PrajwalTomar_: 你的向量数据库正在悄无声息地拖垮你的AI智能体,而你完全不知道。陷阱就在这里。每个人都选了那个……

X AI KOLs Following

一条推文警告说,仅根据速度基准测试选择向量数据库可能会对AI智能体造成陷阱,因为AI智能体具有持续的写入负载,这与RAG以读取为主的模式不同。它根据用例推荐了特定的数据库,例如用于智能体记忆的Qdrant,以及用于PostgreSQL上低于1000万向量的pgvector。