用于检索增强生成的查询感知源风险分流
摘要
本文提出了一种用于检索增强生成(RAG)管道的查询感知分流层,以处理源与查询之间的实质性关系,通过在合成数据上评估的评分和路由方法来定义风险覆盖目标。
arXiv:2609.16564v1 Announce Type: new
摘要:检索增强生成(RAG)管道可能会忽略源与查询之间的实质性关系。我们研究了一种预生成分流层,该层将此关系视为查询相关的方法。该方法将规范查询族路由以进行增强审查,并将检索到的页面分配为通过、上下文化、排除或审查。它结合了四维页面评分、排名折扣族聚合、意图保持查询变异和族持出路由器。一个包含200个真实URL的单一编码试点提供了临时校准锚点;一个包含20,000行合成领域标识符的场景支持受控工作负载分析。一个预言机页面门为未来的学习分类器定义了风险覆盖目标。评估显示了为什么页面级频率不能替代族级暴露,并量化了校准如何改变场景激活。标注可靠性仍未测量,合成排名忽略了真实检索动态。结果是一个可审计的分流方法和验证计划,而不是部署审查工作量、实时网络普遍性或下游答案质量增益的估计。
查看缓存全文
缓存时间: 2026/09/16 09:00
# 基于查询感知的检索增强生成来源风险分类方法 来源: https://arxiv.org/abs/2609.16564 查看PDF (https://arxiv.org/pdf/2609.16564) > 摘要:检索增强生成(RAG)流程可能忽略来源材料与查询的相关性。本研究提出一种预生成分层处理机制,将这种关联性视为与查询相关的动态属性。该方法将典型查询族路由至增强审核通道,并将检索到的页面分配为通过、情境化、排除或需审核四种状态。其核心融合四维页面评分、折扣排名的查询族聚合、保持意图的查询变异以及查询族隔离路由器。通过200个真实URL的单编码试点建立初步校准锚点,并利用20,000行带合成领域标识的数据场景进行可控工作负载分析。设置预言式页面门控为未来学习型分类器定义风险-覆盖目标。评估结果揭示:页面级频率无法替代查询族级曝光评估,并量化了校准调整对场景激活率的影响。注释可靠性尚未验证,合成排名未纳入真实检索动态。最终成果是可审计的分类方法与验证方案,而非已部署审核工作负载、实时网络分布或下游答案质量提升的估计值。 ## 提交历史记录 来自:陆毅 \[查看邮件 (https://arxiv.org/show-email/e4c89fb0/2609.16564)\] **\[v1\]** 2026年9月15日 周二 03:01:27 UTC (775 KB)
相似文章
面向检索增强生成的源感知重排序:一种可靠性先验方法
本文介绍了一种面向RAG的源感知重排序方法,该方法引入了基于领域信息的源可靠性先验,在一个由120份文档组成的健康领域语料库上将Precision@5从0.48提升至0.72,并减少了对抗性文档的检索。
高風險醫療檢索增強生成的聲明選擇性認證
本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。
RAG-CT:通过扫描提示分布缓解检索增强生成系统的隐私风险
RAG-CT是一种新颖的防御方法,通过分析熵和边缘分布来识别恶意查询,从而缓解检索增强生成系统的隐私风险,显著减少PII泄露。
检索增强生成解决了大多数团队实际上并不存在的问题
文章论点是检索增强生成(RAG)在AI系统中经常被误用,真正的问题在于上下文策展而非检索。它表明RAG仅对大规模、频繁变化的语料库真正有益。
SelfGraphRAG:通过合成QA生成弥合基于图的RAG中的监督缺口
SelfGraphRAG引入了一个框架,该框架从知识图谱生成合成问答对,以解决基于图的检索增强生成中的监督缺口,提升检索精度和推理性能。