用于检索增强生成的查询感知源风险分流

arXiv cs.AI 论文

摘要

本文提出了一种用于检索增强生成(RAG)管道的查询感知分流层,以处理源与查询之间的实质性关系,通过在合成数据上评估的评分和路由方法来定义风险覆盖目标。

arXiv:2609.16564v1 Announce Type: new 摘要:检索增强生成(RAG)管道可能会忽略源与查询之间的实质性关系。我们研究了一种预生成分流层,该层将此关系视为查询相关的方法。该方法将规范查询族路由以进行增强审查,并将检索到的页面分配为通过、上下文化、排除或审查。它结合了四维页面评分、排名折扣族聚合、意图保持查询变异和族持出路由器。一个包含200个真实URL的单一编码试点提供了临时校准锚点;一个包含20,000行合成领域标识符的场景支持受控工作负载分析。一个预言机页面门为未来的学习分类器定义了风险覆盖目标。评估显示了为什么页面级频率不能替代族级暴露,并量化了校准如何改变场景激活。标注可靠性仍未测量,合成排名忽略了真实检索动态。结果是一个可审计的分流方法和验证计划,而不是部署审查工作量、实时网络普遍性或下游答案质量增益的估计。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:00

# 基于查询感知的检索增强生成来源风险分类方法
来源: https://arxiv.org/abs/2609.16564
查看PDF (https://arxiv.org/pdf/2609.16564)

> 摘要:检索增强生成(RAG)流程可能忽略来源材料与查询的相关性。本研究提出一种预生成分层处理机制,将这种关联性视为与查询相关的动态属性。该方法将典型查询族路由至增强审核通道,并将检索到的页面分配为通过、情境化、排除或需审核四种状态。其核心融合四维页面评分、折扣排名的查询族聚合、保持意图的查询变异以及查询族隔离路由器。通过200个真实URL的单编码试点建立初步校准锚点,并利用20,000行带合成领域标识的数据场景进行可控工作负载分析。设置预言式页面门控为未来学习型分类器定义风险-覆盖目标。评估结果揭示:页面级频率无法替代查询族级曝光评估,并量化了校准调整对场景激活率的影响。注释可靠性尚未验证,合成排名未纳入真实检索动态。最终成果是可审计的分类方法与验证方案,而非已部署审核工作负载、实时网络分布或下游答案质量提升的估计值。

## 提交历史记录

来自:陆毅 \[查看邮件 (https://arxiv.org/show-email/e4c89fb0/2609.16564)\] **\[v1\]** 2026年9月15日 周二 03:01:27 UTC (775 KB)

相似文章

高風險醫療檢索增強生成的聲明選擇性認證

arXiv cs.CL

本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。