@thesupermanmx: Google DeepMind 认为 RAG 已经失效。他们发表了一篇论文,证明向量数据库是死胡同。对于过去…

X AI KOLs Timeline 论文

摘要

Google DeepMind 的一篇论文认为,RAG 系统中的单向量嵌入存在严格的数学极限,证明向量数据库无法完全捕捉复杂的文档关系。他们引入了 LIMIT 压力测试数据集,以展示最先进的模型在结构化查询上也会失败。

Google DeepMind 认为 RAG 已经失效。 他们发表了一篇论文,证明向量数据库是死胡同。 过去三年来,面对任何 AI 记忆或数据问题,工程师的默认回应都是一样的:“只需构建一个 RAG 管道。” 将数据分块,推入向量数据库,剩下的交给嵌入模型处理。 每一家扩展企业级 AI 的公司都认为,如果嵌入模型失败,那只是时间问题。更好的训练数据、更大的模型、更多的参数——投入算力,搜索就会变得更聪明。 这篇论文证明,这个假设完全是错误的。 他们从数学上证明了,单向量嵌入有一个难以逾越的硬性极限。 核心缺陷如下: 嵌入会将整篇文档或复杂的查询压缩成一个固定长度的数字向量。 当你执行搜索时,模型会计算这些向量的点积来衡量相似性。 数学揭示了一个残酷的约束:模型针对不同查询可能检索到的不同文档组合数量,严格受限于其嵌入空间的维度。 这是一个由几何和通信复杂性决定的硬性数学上限。 再多的数据扩展也无法修复它。再多的微调也无法突破它。 即使你给嵌入模型在测试集上无限、无约束的训练自由,它仍然会撞上这堵墙。 DeepMind 构建了一个名为 LIMIT 的压力测试数据集来证明这一点。 他们用最先进的嵌入模型去测试,这些模型有数千个维度。 模型完全失败了。即使在简单的结构化查询上,单向量瓶颈也迫使系统丢失关键上下文,并幻觉出不相关的结果。 为什么?因为单个向量无法捕捉文档之间复杂、多面的关系。 当你要求 AI 进行推理、遵循复杂指令,或处理微妙的跨文档依赖时,向量空间根本没有足够的空间。 它会崩溃。 这改变了软件架构的一切。 如果你的 AI 智能体记忆依赖标准的单向量检索,它在结构上就对复杂逻辑视而不见。它现在正在丢失你的数据片段,任何提示词调整都无法拯救它。 如果我们想要真正理解企业知识的 AI,就必须抛弃单向量。 并发明全新的东西。
查看原文
查看缓存全文

缓存时间: 2026/08/10 13:30

Google DeepMind 认为 RAG 已经过时了。

他们发表了一篇论文,证明了向量数据库是一条死胡同。

过去三年,面对任何 AI 记忆或数据问题,默认的工程解决方案都一样:“只要搭一个 RAG 管道就行。”

把数据分块,存入向量数据库,剩下的交给嵌入向量处理。

每个在扩展企业 AI 的公司都假设,如果嵌入模型效果不佳,那只是时间问题。更好的训练数据、更大的模型、更多的参数——用算力去砸,搜索就会变得更聪明。

这篇论文证明这个假设完全错误。

他们从数学上证明,单向量嵌入存在一个无法跨越的硬性上限。

核心缺陷如下:

嵌入会将整个文档或复杂查询压缩成一个固定长度的数字向量。

当你运行搜索时,模型会计算这些向量的点积来度量相似性。

数学揭示了一个残酷的约束。模型能够为不同查询检索到的不同文档组合的数量,严格受限于其嵌入空间的维度。

这是一个由几何学和通信复杂性决定的硬性数学天花板。

数据规模再大也无法解决。微调再多也无法突破。

即便你给嵌入模型无限的、不受约束的训练自由度(甚至允许其在测试集上训练),它仍然会撞墙。

DeepMind 构建了一个名为 LIMIT 的压力测试数据集来证明这一点。

他们用最先进的嵌入模型(这些模型有数千个维度)去测试。

模型完全失败。即使面对简单、结构化的查询,单向量瓶颈也会迫使系统丢失关键上下文,并产生不相关的幻觉结果。

为什么?因为单个向量无法捕捉文档之间复杂的、多层面的关系。

当你要求 AI 进行推理、遵循复杂指令或处理细微的跨文档依赖关系时,向量空间根本不够用。

它会崩溃。

这改变了软件架构的一切。

如果你的 AI 代理的记忆依赖于标准的单向量检索,它在结构上就无法看到复杂的逻辑。它现在就在丢失你数据的部分内容,而且任何提示词调整都无法挽救它。

如果我们想要真正理解企业知识的 AI,就必须抛弃单向量。

并发明一些全新的东西。

相似文章

@vintcessun: RAG喂太多文档,检索质量反而从75%掉到40%?向量搜索被大量无关内容稀释,真实部署中命中率暴跌。 问题根源:异构文档混在一起检索,噪声淹没了信号。多智能体编排看似智能,实际引入精度-忠实度悖论——配置稍差就两头不讨好。 论文提出的MA…

X AI KOLs Timeline

This paper identifies 'vector search dilution' in RAG systems when scaling to large heterogeneous document collections, where accuracy dropped from 75% to 40% in a real-world deployment. The proposed MASDR-RAG method uses domain scoping via organizational metadata before retrieval, improving P@10 from 0.77 to 0.86 with low cost and easy deployment.