不,RAG无法取代一个好模型。

Reddit r/AI_Agents 新闻

摘要

本文批判了检索增强生成(RAG)系统,通过实验证明嵌入无法捕捉矛盾等上下文细节,导致幻觉,并强调了强大底层模型在准确AI响应中的关键作用。

我使用nomic-embed-text在Ollama上嵌入了四个政策句子,并针对一个问题进行了评分:"如果我取消婚礼,可以退款吗?" "在仪式前30天或更早取消可获得全额退款。" 0.7216 "在仪式前30天或更早取消不可退款。" 0.7260 不可退款的句子排名第一。在五种不同表述的问题中,两者得分从未相差超过约0.02,并且相互评分时得分为0.97。嵌入编码了文本的主题内容。它表达肯定或否定是一个他们大多忽略的细节。然后我问是否可以带我的狗。这四个句子都没有回答这个问题。最高匹配是结婚许可证要求,得分为0.59,因为向量搜索没有"不匹配"的概念。总有最近的项。距离截止值可以处理狗的问题。即使是一个好的系统也会放行与事实相反的句子,因为它是关于同一主题的。流传的说法是RAG使模型成为一个细节,或者它将向量存储变成了模型自身的权重。插入一百万行数据,权重文件也不会改变一个字节。检索决定了模型看到什么。权重决定了模型如何处理它:注意到两个块相互矛盾,推断出2026年的政策取代了排名第一的2023年政策,并且说它不知道关于狗的情况,而不是编造宠物政策。商业RAG以相同的方式失败。LexisNexis推广Lexis+ AI时声称具有"无幻觉"的链接引用。一个斯坦福/耶鲁团队通过它和Westlaw的AI辅助研究手动运行了202个预注册的法律查询。Lexis在超过六分之一的情况下产生幻觉,Westlaw在三分之一的情况下产生幻觉,并且对于Westlaw,推理错误导致了61%的幻觉答案。检索结果通常看起来相关。我运行一个生产代理,一个为拉斯维加斯婚礼教堂服务的AI婚礼策划师,通过Microsoft.Extensions.AI使用Claude Opus。实时数据通过我为预订系统编写的.NET 10 MCP连接器获取,因为十月某个周六是否开放是一个WHERE子句问题,而不是相似性问题。人设是执行六阶段咨询的高级策划师,没有人检索纪律来在长对话中遵循六个阶段。当Anthropic的API在中途过载时,代理会回退到Sonnet。回退也是一个前沿模型。是否有人让重排器可靠地分离像退款对这样的矛盾,还是这总是落在模型上?在评论中按照本论坛的规则提供重现此内容的详细说明和代码(C#、Agent Framework的TextSearchProvider、SQL Server 2025向量,以及CU9陷阱,其中DiskANN索引使表变为只读)
查看原文

相似文章

为什么检索增强生成会失败:图视角

arXiv cs.CL

本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。

RAG 幻觉烦得要命

Reddit r/AI_Agents

团队发现 80% 的 RAG 幻觉是由检索不佳导致的,而非生成模型的问题,强调需要分别评估检索与生成环节,才能有效调试错误答案。

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。