高風險醫療檢索增強生成的聲明選擇性認證

arXiv cs.CL 论文

摘要

本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。

arXiv:2605.21949v1 公告類型:新 摘要:在高風險問答場景中,醫療RAG系統通常通過單一的應答或棄權決策進行評估,但混合證據可能支持某一聲明,對另一聲明需要條件,而對第三條聲明則相矛盾。我們研究了聲明選擇性認證:每個響應被分解為可驗證的聲明,根據檢索到的證據進行評分,並由意圖感知選擇器映射到{完整,部分,衝突,棄權}。在主要弱標籤證書協議上,其僅真實來源的開發/測試行覆蓋了自然發生的非棄權操作,完整系統在開發集(n=314)上記錄UCCR=0.0000,PAU=1.0000,PAU精確率=0.9901,操作準確率=0.9204;在測試集(n=319)上記錄UCCR=0.0000,PAU=0.9967,PAU精確率=0.9739,操作準確率=0.8997。UCCR衡量證書定義內的無支持聲明風險,而一個缺失源的因果對照切片評估空證據下的棄權。捷徑控制量化了由源和意圖元數據解釋的操作標籤先驗,而源/證據新穎切片則刻畫了遷移邊界。最終的介面在混合證據下將操作標籤預測與證據關聯的聲明選擇分離開來。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:44

# 高风险医疗检索增强生成系统的声明选择性认证  
来源:https://arxiv.org/html/2605.21949  
邵刊 精略科技发展(南京)有限公司,南京市经济技术开发区恒泰路8号汇智科技园A2栋12层1215-13室,南京,中国  
[email protected] https://orcid.org/0009-0003-4872-6193  

###### 摘要  
在高风险问答场景中,医疗检索增强生成系统通常通过单一的“回答或弃权”决策来评估,但混合证据可能支持某一主张、对另一主张附加条件,同时又与第三个主张矛盾。我们研究**声明选择性认证**:将每个响应分解为可验证的声明单元,依据检索到的证据进行评分,并通过一个意图感知选择器映射到{完全回答、部分回答、冲突回答、弃权}。在主要的弱标签认证协议上,其实境来源开发/测试行覆盖自然发生的非弃权动作,开发集(n=314)上系统记录的UCCR=0.0000,PAU=1.0000,PAU精确率=0.9901,动作准确率=0.9204;测试集(n=319)上UCCR=0.0000,PAU=0.9967,PAU精确率=0.9739,动作准确率=0.8997。UCCR衡量认证定义范围内无支持主张的风险;一个源缺失反事实切片评估空证据下的弃权行为。快捷方式控制量化由源和意图元数据解释的动作标签先验,而源/证据新颖性切片则刻画迁移边界。最终接口在混合证据下将动作标签预测与证据关联的声明选择分离开来。  

## 1 引言  
检索增强生成通过将语言模型锚定到外部知识[17(https://arxiv.org/html/2605.21949#bib.bib1),7(https://arxiv.org/html/2605.21949#bib.bib2)],但在高风险医疗问答中存在不对称的回答契约:无支持的安全、剂量或禁忌症主张可能造成伤害,而全面弃权则可能压抑可用证据。同一组证据可能支持一个剂量限制,对监测留下不确定性,同时又与一个禁忌症相矛盾。我们研究**声明选择性认证**:将问题分解为可验证的声明单元,对每个声明依据证据评分,并选择是直接陈述、附加条件陈述、质疑还是保留不陈述。实现包含三个阶段:基于模板的声明分解、基于线索的关系评分(用于支持、冲突和限制信号),以及一个**意图感知的风险校准选择器**。选择器接收一个`question_intent`:涉及妊娠、哺乳、监测和特殊人群的问题通常需要条件限制性措辞,而禁忌症和相互作用问题则更需要认证或冲突处理。我们在2,223个医疗问答样本上评估该接口,其中2,103个(94.6%)来自公开下载的实境来源,120个(5.4%)为合成样本。主要结果使用实境来源专用划分,而合成、源缺失、以及源/证据新颖性切片则分别刻画系统在合成样本、空证据和源/证据新颖性下的行为。我们在相同的弱标签认证协议下,比较了纯阈值、二元形式、基于NLI、学习型关系以及完整的声明选择性系统。本研究贡献了一个声明级认证/动作公式、一个意图感知的固定策略层,以及一个生成认证的评估框架,该框架报告UCCR、PAU、PAU精确率、动作准确率、风险-覆盖度、源重叠、快捷方式以及源/证据新颖性分析,用于高风险医疗RAG。  

## 2 相关工作  
检索增强生成通过检索外部文档并以此为基础条件生成,将语言模型锚定[17(https://arxiv.org/html/2605.21949#bib.bib1),10(https://arxiv.org/html/2605.21949#bib.bib3),7(https://arxiv.org/html/2605.21949#bib.bib2)]。近期许多工作通过稠密检索[14(https://arxiv.org/html/2605.21949#bib.bib4)]、迭代检索与自我反思[2(https://arxiv.org/html/2605.21949#bib.bib5)]、用于RAG管道的查询重写[18(https://arxiv.org/html/2605.21949#bib.bib6)]或组合问题的分解策略[24(https://arxiv.org/html/2605.21949#bib.bib7)],改善了证据获取。RAG方法决定了模型可用的证据。我们的设置从下一个决策点开始:一旦证据可用,哪些声明应该出现在答案中?选择性预测和弃权通过保留低置信度预测来降低风险[8(https://arxiv.org/html/2605.21949#bib.bib8),13(https://arxiv.org/html/2605.21949#bib.bib9)]。相关的QA和对话工作研究了时间敏感的可回答性[3(https://arxiv.org/html/2605.21949#bib.bib10)]、校准的信念状态分布[32(https://arxiv.org/html/2605.21949#bib.bib11)]以及基于含义而非表层字符串的不确定性[16(https://arxiv.org/html/2605.21949#bib.bib12)]。当实例全局可回答、不可回答或不确定时,这些方法有效;但当医疗问题包含多个处于不同证据状态的声明时,它们的表达能力不足。我们保持风险控制目标,但将决策单元从整个响应转移至单个声明和动作类型。  

忠实性与事实核查方法验证生成的或提出的声明是否得到来源支持[19(https://arxiv.org/html/2605.21949#bib.bib13),5(https://arxiv.org/html/2605.21949#bib.bib14),25(https://arxiv.org/html/2605.21949#bib.bib15),31(https://arxiv.org/html/2605.21949#bib.bib17),27(https://arxiv.org/html/2605.21949#bib.bib18)],而基于引用的生成工作则研究模型如何在输出中呈现归因证据[6(https://arxiv.org/html/2605.21949#bib.bib16)]。更直接地,长文本事实性评估器将响应分解为原子事实并检查证据支持[21(https://arxiv.org/html/2605.21949#bib.bib19),4(https://arxiv.org/html/2605.21949#bib.bib20)],而像MiniCheck这样的高效接地检查器则训练更小的模型用于文档接地的事实验证[30(https://arxiv.org/html/2605.21949#bib.bib21)]。这些工作在声明或事实层面上使事实支持变得可衡量。声明选择性RAG在管道的更早期使用同类信号,在最终响应形成之前,将每个声明映射到一个显式动作和认证状态,而不仅仅是评分一个已完成答案。  

诊断性评估工作表明,高聚合准确率可能隐藏快捷方式行为、标注伪影以及分布偏移失败。先前的研究通过仅假设伪影分析[9(https://arxiv.org/html/2605.21949#bib.bib22)]、受控启发式挑战集[20(https://arxiv.org/html/2605.21949#bib.bib23)]、行为测试套件[26(https://arxiv.org/html/2605.21949#bib.bib24)]、数据映射[29(https://arxiv.org/html/2605.21949#bib.bib25)]以及野外分布偏移基准[15(https://arxiv.org/html/2605.21949#bib.bib26)]来暴露此类行为。我们将同样的视角引入声明选择性RAG:快捷方式控制、源/证据新颖性切片以及源缺失弃权评估,将认证生成行为与标签空间先验和迁移失败分离开来。  

医疗问答已在检索、基准和大模型设置中得到研究[1(https://arxiv.org/html/2605.21949#bib.bib27),12(https://arxiv.org/html/2605.21949#bib.bib28),11(https://arxiv.org/html/2605.21949#bib.bib29),23(https://arxiv.org/html/2605.21949#bib.bib30),28(https://arxiv.org/html/2605.21949#bib.bib31),22(https://arxiv.org/html/2605.21949#bib.bib32)]。许多数据集评估多选题、是/否或完整答案行为。然而,实际医疗问题往往需要部分支持、禁忌症处理或条件特定措辞。本工作针对这一接口差距,通过评估声明级选择、显式动作校准以及诸如UCCR和PAU这样的风险-效用指标来加以解决。  

## 3 问题形式化  
令 \( q \) 表示一个医疗问题,令 \( \mathcal{E} = \{ e_1, \dots, e_k \} \) 为系统可用的检索证据。传统的RAG策略生成一个响应 \( r = \mathrm{LM}(q, \mathcal{E}) \) 并作为一个整体进行评估。这对于混合证据过于粗粒度:同一组证据包可能支持一个主张,仅条件性支持第二个主张,与第三个矛盾,并且使第四个主张无支持。我们转而将响应视为关于声明的决策。接口首先产生一组小的可验证声明骨架 \( \mathcal{C} = \{ c_1, \dots, c_n \} \) 以及每个声称的元数据 \( m_i \),包括问题意图和声明类型。每个声称-证据对接收一个关系向量:

\[
\mathbf{s}(c_i, e_j) = (s_{\mathrm{sup}}, s_{\mathrm{conf}}, s_{\mathrm{lim}}) \in [0,1]^3,
\tag{1}
\]

其中坐标概括了支持、冲突和限制/条件性。分数通过最大聚合跨越证据进行汇总:

\[
S_{\ell}(c_i) = \max_{e_j \in \mathcal{E}} s_{\ell}(c_i, e_j), \quad \ell \in \{\mathrm{sup}, \mathrm{conf}, \mathrm{lim}\}.
\tag{2}
\]

选择器将 \( (S_{\mathrm{sup}}, S_{\mathrm{conf}}, S_{\mathrm{lim}}, m_i) \) 映射到一个声称状态:

\[
z_i \in \{\mathrm{certified}, \mathrm{condition\mbox{-}limited}, \mathrm{conflicting}, \mathrm{omitted}\}.
\tag{3}
\]

认证和条件限制声明可以附带证据链接表达;冲突声明触发冲突行为;省略声明则保留不表达。最终动作是所选声明集的粗粒度总结:

\[
a \in \{\texttt{full}, \texttt{partial}, \texttt{conflict}, \texttt{abstain}\}.
\tag{4}
\]

直观上,`full`表示所请求的答案可以直接陈述,`partial`表示存在可用信息但需要警告或省略,`conflict`表示应揭示实质性证据分歧或风险,`abstain`表示不应表达任何声明。因此动作并非自由形式的答案标签;而是由声明级状态和证据认证所诱导的策略决策。  

评估遵循相同的声明接口。令 \( \mathcal{P} \) 为表达出的预测声明,\( \mathcal{G}_{\mathrm{use}} \) 为弱标签协议下构造导出的金标准可用声明。**无支持关键声明率**(UCCR)衡量表达的关键声明中的认证级风险:

\[
\mathrm{UCCR} = \frac{|\{c \in \mathcal{P}: c \text{ is critical and } c \notin \mathcal{G}_{\mathrm{use}}\}|}{|\{c \in \mathcal{P}: c \text{ is critical}\}|},
\tag{5}
\]

当未表达任何关键声明时定义为0。目标是零个无支持表达的关键声明。**部分回答效用**(PAU)衡量保留的可用信息:

\[
\mathrm{PAU} = \frac{|\mathcal{P} \cap \mathcal{G}_{\mathrm{use}}|}{|\mathcal{G}_{\mathrm{use}}|}.
\tag{6}
\]

我们还报告PAU精确率和F1,以区分保留可用声明与过多表达额外声明,以及动作准确率以评估四路动作接口。这些是弱标签上的协议度量,而非专家临床判断。  

该公式使得核心权衡显式化。如果证据支持 \( \mathcal{C}_{\mathrm{sup}} \subset \mathcal{C} \) 而不支持剩余声明,那么文档级答案策略很大程度上只能选择表达所有内容(可能提高UCCR)或弃权(降低PAU)。声明选择性策略则可以表达 \( \mathcal{C}_{\mathrm{sup}} \),省略无支持声明,并在适当时返回`partial`。实验探究该接口是否能在保留效用的同时满足认证目标,以及由此产生的动作是否超越快捷方式先验而具有意义。  

## 4 方法  
系统遵循三阶段流水线:声明分解、关系评分和意图感知风险校准选择。我们研究检索后决策层:给定固定的证据集,系统决定哪些声明应被认证、条件限制、质疑或省略。图1(https://arxiv.org/html/2605.21949#S4.F1)总结了该流水线。系统暴露一小批候选声明,对每个声明依据检索证据评分,并应用显式动作策略。这使得主要决策在弱监督下可检查,并能够将动作校准与开放式生成分离评估。  

![图1](https://arxiv.org/html/2605.21949#S4.F1)  
图1:系统架构。流水线结合了基于模板的声明分解与显式问题意图、基于线索的关系评分以及意图感知风险校准选择器。  

### 4.1 设计原理  
设计聚焦于检索后决策边界:声明接口固定了决策单元,关系评分器暴露支持、冲突和限制信号,选择器将这些信号映射到动作。这种结构使我们能够在共同的弱标签协议下研究动作校准,同时将声明选择、认证和审计锚定到显式的中间变量。  

### 4.2 声明分解  
给定查询 \( q \),分解层发射可验证的声明骨架 \( \mathcal{C} = \{ c_1, \dots, c_n \} \)。模板生成一小批高层关键声明,而非无限制的细粒度提取。每个查询还接收一个`question_intent`,涵盖适应症、剂量、禁忌症、相互作用、妊娠/哺乳、监测、漏服剂量和特殊人群问题。由此产生的骨架为在共同弱标签协议下研究选择性包含、条件限制措辞、冲突处理和省略提供了一个稳定接口。  

表1:声明模板与选择器策略接口。行总结了选择器使用的操作族。  

### 4.3 关系评分  
对于每个声明-证据对 \( (c_i, e_j) \),关系模块估计支持、冲突和限制分数。评分器结合词汇重叠与一个线索词典,以识别证据是支持、反驳还是仅条件下支持该声明。线索词典包含来自标签和摘要的英文短语。分数通过最大风格池化被聚合到检索证据上,使得一个强段落能够激活相关的关系信号:

\[
\begin{aligned}
S_{\text{support}}(c_i) &= \max_{e_j \in \mathcal{E}} s_{\text{support}}(c_i, e_j) \tag{7} \\
S_{\text{conflict}}(c_i) &= \max_{e_j \in \mathcal{E}} s_{\text{conflict}}(c_i, e_j) \tag{8} \\
S_{\text{limitation}}(c_i) &= \max_{e_j \in \mathcal{E}} s_{\text{limitation}}(c_i, e_j). \tag{9}
\end{aligned}
\]

评分器保留原始的`question_intent`,因此选择器可以同时依据证据关系和问题类型进行条件操作。  

### 4.4 意图感知风险校准选择  
选择器将每个评分后的声明

相似文章

用于检索增强生成的查询感知源风险分流

arXiv cs.AI

本文提出了一种用于检索增强生成(RAG)管道的查询感知分流层,以处理源与查询之间的实质性关系,通过在合成数据上评估的评分和路由方法来定义风险覆盖目标。

面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析

arXiv cs.CL

本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。