不,RAG无法取代一个好模型。
摘要
本文批判了检索增强生成(RAG)系统,通过实验证明嵌入无法捕捉矛盾等上下文细节,导致幻觉,并强调了强大底层模型在准确AI响应中的关键作用。
我使用nomic-embed-text在Ollama上嵌入了四个政策句子,并针对一个问题进行了评分:"如果我取消婚礼,可以退款吗?" "在仪式前30天或更早取消可获得全额退款。" 0.7216 "在仪式前30天或更早取消不可退款。" 0.7260 不可退款的句子排名第一。在五种不同表述的问题中,两者得分从未相差超过约0.02,并且相互评分时得分为0.97。嵌入编码了文本的主题内容。它表达肯定或否定是一个他们大多忽略的细节。然后我问是否可以带我的狗。这四个句子都没有回答这个问题。最高匹配是结婚许可证要求,得分为0.59,因为向量搜索没有"不匹配"的概念。总有最近的项。距离截止值可以处理狗的问题。即使是一个好的系统也会放行与事实相反的句子,因为它是关于同一主题的。流传的说法是RAG使模型成为一个细节,或者它将向量存储变成了模型自身的权重。插入一百万行数据,权重文件也不会改变一个字节。检索决定了模型看到什么。权重决定了模型如何处理它:注意到两个块相互矛盾,推断出2026年的政策取代了排名第一的2023年政策,并且说它不知道关于狗的情况,而不是编造宠物政策。商业RAG以相同的方式失败。LexisNexis推广Lexis+ AI时声称具有"无幻觉"的链接引用。一个斯坦福/耶鲁团队通过它和Westlaw的AI辅助研究手动运行了202个预注册的法律查询。Lexis在超过六分之一的情况下产生幻觉,Westlaw在三分之一的情况下产生幻觉,并且对于Westlaw,推理错误导致了61%的幻觉答案。检索结果通常看起来相关。我运行一个生产代理,一个为拉斯维加斯婚礼教堂服务的AI婚礼策划师,通过Microsoft.Extensions.AI使用Claude Opus。实时数据通过我为预订系统编写的.NET 10 MCP连接器获取,因为十月某个周六是否开放是一个WHERE子句问题,而不是相似性问题。人设是执行六阶段咨询的高级策划师,没有人检索纪律来在长对话中遵循六个阶段。当Anthropic的API在中途过载时,代理会回退到Sonnet。回退也是一个前沿模型。是否有人让重排器可靠地分离像退款对这样的矛盾,还是这总是落在模型上?在评论中按照本论坛的规则提供重现此内容的详细说明和代码(C#、Agent Framework的TextSearchProvider、SQL Server 2025向量,以及CU9陷阱,其中DiskANN索引使表变为只读)
相似文章
检索增强生成解决了大多数团队实际上并不存在的问题
文章论点是检索增强生成(RAG)在AI系统中经常被误用,真正的问题在于上下文策展而非检索。它表明RAG仅对大规模、频繁变化的语料库真正有益。
为什么检索增强生成会失败:图视角
本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。
RAG 幻觉烦得要命
团队发现 80% 的 RAG 幻觉是由检索不佳导致的,而非生成模型的问题,强调需要分别评估检索与生成环节,才能有效调试错误答案。
我见到的大多数智能体RAG问题都是检索问题,而非模型问题
作者认为大多数智能体RAG失败源于检索问题——具体包括分块错误、缺乏新鲜度信号以及依赖纯向量搜索——而非大语言模型本身,并建议采用结构化分块、基于衰减的排序以及BM25+向量的混合搜索。
当检索无济于事:一项大规模生物医学 RAG 研究
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。