哪些医学问题应获得理由?面向稳健问答的扰动敏感选择方法

arXiv cs.CL 论文

摘要

本文提出RMS-RSP,一种扰动敏感方法,用于选择接受理由监督的医学问题,提升问答系统的稳健准确性和语义一致性。

arXiv:2609.09684v1 公告类型:新 摘要:医学问答数据集通常包含答案标签,而高质量的理由仍然稀少、嘈杂或验证成本高昂。这改变了获取问题:与其问哪些问题应该被标注,我们问在固定令牌预算下,哪些已标注的问题应该接受理由监督。我们研究了这个问题的一个离线版本,其中候选理由对选择器可见,但除非被选中,否则不会传递到下游训练。我们提出均方根鲁棒性样本优先级排序(RMS-RSP),该方法仅在理由令牌上扰动隐藏状态,并测量金标准与最佳干扰项之间差距的变化。在五个医学问答数据集、MedGemma-4B-IT、三个训练种子、十个预算化的非RSP选择器和一个无预算的全监督参考上,RMS-RSP提供了经过精心限定的结果。其锁定预算下的平均准确率为60.61%,而随机选择为60.08%,仅在AfriMed-QA上有统计显著提升(+1.44点)。其全预算准确率区域并不优于随机选择。然而,在三次答案选项重排后,RMS-RSP平均提升稳健准确性和语义一致性分别达1.91点和2.85点,且在五个数据集上方向一致。在所有池化理由上训练将宏观准确率提高到63.74%,但消耗的令牌数量是原来的29至254倍,且并未均匀提升稳健性。这些发现并未确立普遍的准确率提升;相反,它们表明理由局部边界敏感性可以识别出能提高对语义等价格式变化不变性的监督。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:13

# 哪些医学问题值得提供理由?针对鲁棒问答的扰动敏感性选择
来源:https://arxiv.org/html/2609.09684  
于大佑 Vasile Rus  
隶属机构:孟菲斯大学计算机科学系  
邮箱:ywu10@memphis\.edu  dayou\.yu@memphis\.edu  vrus@memphis\.edu

###### 摘要

医学问答数据集通常包含答案标签,但高质量的理由标注却稀缺、嘈杂或验证成本高昂。这改变了获取问题的性质:与其询问哪些问题应被标注,我们转而在固定令牌预算下,研究哪些已标注的问题应接受理由监督。我们研究该问题的离线版本,其中候选理由对选择器可见,除非被选中,否则不用于下游训练。我们提出均方根鲁棒性样本优先级排序法,该方法仅在理由令牌处扰动隐状态,并衡量由此产生的正确答案与最佳干扰项之间置信度差值的变化。在五个医学问答数据集、MedGemma-4B-IT模型、三种训练种子、十个预算有限的非RSP选择器以及一个无预算的全监督参考条件下,RMS-RSP提供了经过严格验证的结果。其固定预算准确率平均为60.61%,优于随机选择的60.08%,且仅在AfriMed-QA数据集上获得了统计显著的提升(+1.44个百分点)。其全预算准确率区间并不优于随机选择。然而,在经历三次答案选项重排序后,RMS-RSP平均将鲁棒准确率和语义一致性分别提升了1.91和2.85个百分点,且在所有五个数据集上均呈现相同趋势。使用全部理由进行训练可将宏平均准确率提高至63.74%,但消耗的令牌量是前者的29至254倍,且未能均匀提升鲁棒性。这些发现并未确立普遍的准确率提升;相反,它们表明基于理由的边界敏感性识别出的监督,能够增强模型对语义等价格式变化的恒常性。

## 1引言

医学问答数据集通常在远超严格审查解释的规模上提供答案标签。理由文本更长,需要领域专业知识来编写或验证,且即使最终答案正确,也可能包含无关或错误的中间陈述。因此,相关的分配问题不仅是*哪些问题应该被标注*,如传统主动学习(Settles, 2009 (https://arxiv.org/html/2609.09684#bib.bib1))所关注的,而是*哪些已标注问题值得获得额外的理由监督*。这一区别在医学领域尤为重要:不加区分地应用所有可用理由,可能会花费大量的标注或训练预算,同时让模型接触到嘈杂的推理轨迹。

近期推理数据选择器根据答案不确定性、似然性、局部步骤兼容性或早期训练动态对轨迹进行排序(Goncharov等,2026 (https://arxiv.org/html/2609.09684#bib.bib12);Yang等,2026 (https://arxiv.org/html/2609.09684#bib.bib13);Just等,2026 (https://arxiv.org/html/2609.09684#bib.bib14);Wang等,2026 (https://arxiv.org/html/2609.09684#bib.bib15);Jin等,2026 (https://arxiv.org/html/2609.09684#bib.bib16))。这些方法推进了数据高效的推理蒸馏,但大多数是针对数学、编程或通用科学领域开发的。此外,它们的评分并未直接询问理由是否与医学决策边界紧密耦合。在多项选择的医学问答中,这一边界尤为重要:一个有用的理由应支持正确临床选项而非其最强干扰项,而不仅仅是流畅或难以生成。

我们重新审视了鲁棒性样本优先级排序(RSP),并引入了一个归一化的、基于理由局部的评分。给定一个经过答案训练的模型和一个候选理由,我们在多个深层网络中,向理由令牌的隐状态注入均方根尺度的高斯噪声。然后,我们测量正确答案与最佳干扰项之间对数概率差值的变化量。标准的RMS-RSP分数是这些变化量的均方根。该分数经过尺度归一化,对正向和负向的边界变化都敏感,并且与作为监督获取的令牌直接关联。

我们的评估旨在当前证据的局限内进行。我们使用了五个涵盖非洲医学考试、多语言医学考试、代表性不足的专科、生物医学文献和印度入学考试的医学问答数据集(Nimo等,2025 (https://arxiv.org/html/2609.09684#bib.bib8);Alonso等,2024 (https://arxiv.org/html/2609.09684#bib.bib9);Kim等,2024 (https://arxiv.org/html/2609.09684#bib.bib10);Jin等,2019 (https://arxiv.org/html/2609.09684#bib.bib11);Pal等,2022 (https://arxiv.org/html/2609.09684#bib.bib7))。我们将与随机选择、答案熵与差值、理由长度以及五个近期的推理数据选择器进行比较。我们报告固定预算准确率、宏平均F1值、全曲线令牌-AUBC以及答案选项排列的恒常性。我们的贡献包括:

- • 为答案已标注的医学问答精确建立了*预算理由选择*公式,将答案监督与理由监督区分开来;
- • RMS-RSP,一种基于正确答案与干扰项差值变化的、理由局部的、相对尺度扰动评分,并包含符号消融实验;
- • 一项五数据集比较,显示标准准确率存在异质性,但在选项顺序鲁棒准确率和语义一致性方面展现出一致的改进,并提供了高资源全理由参考基准。

## 2相关工作

#### 医学问答中的理由监督。

思维链提示和理由微调可以改进多步推理(Wei等,2022 (https://arxiv.org/html/2609.09684#bib.bib2);Zelikman等,2022 (https://arxiv.org/html/2609.09684#bib.bib3)),但生成的解释未必能忠实描述产生答案的计算过程(Turpin等,2023 (https://arxiv.org/html/2609.09684#bib.bib4))。在医疗领域,这种担忧被放大,因为一个不正确的中间声明可能带来严重后果。医学基准测试在解释来源上差异很大:MedMCQA提供简短解释,MedExpQA提供医生撰写的参考解释,MedExQA提供成对的解释,PubMedQA则将决策与文章结论配对(Pal等,2022 (https://arxiv.org/html/2609.09684#bib.bib7);Alonso等,2024 (https://arxiv.org/html/2609.09684#bib.bib9);Kim等,2024 (https://arxiv.org/html/2609.09684#bib.bib10);Jin等,2019 (https://arxiv.org/html/2609.09684#bib.bib11))。我们将这些理由视为离线获取的参考依据,而非假设每个理由都同等有用。

#### 推理数据选择。

不确定性采样从模型输出中选择困难输入。复杂度感知微调使用答案熵,将推理监督保留给复杂项目(Goncharov等,2026 (https://arxiv.org/html/2609.09684#bib.bib12))。RSR平衡令牌排名与意外度,以识别与学生模型一致但信息量大的轨迹(Yang等,2026 (https://arxiv.org/html/2609.09684#bib.bib13))。LALP从受限的本地上下文对每一步进行评分(Just等,2026 (https://arxiv.org/html/2609.09684#bib.bib14)),而ASLEC-DROP则移除低概率的首个令牌,以避免其混淆自然性评分与步骤长度(Wang等,2026 (https://arxiv.org/html/2609.09684#bib.bib15))。TEMP结合随机参数扰动下的损失和沿微小理由-LoRA方向外推的检查点,并观察到有用的推理轨迹可以被早期识别(Jin等,2026 (https://arxiv.org/html/2609.09684#bib.bib16))。这些是相近的基线方法,因为它们解决相同的监督分配问题。RSP的不同之处在于扰动理由位置的激活值,并测量答案边界的响应。

#### 多项选择鲁棒性。

大语言模型即使在答案选项语义内容不变的情况下,仅因其重排序也可能改变预测(Pezeshkpour与Hruschka,2024 (https://arxiv.org/html/2609.09684#bib.bib17);Zheng等,2024 (https://arxiv.org/html/2609.09684#bib.bib18))。因此,我们不仅评估原始顺序的准确率。我们并未声称选项排列能模拟所有临床分布偏移;它们是与RSP决策边界动机相符的受控恒常性测试。

## 3预算理由选择

### 3.1问题设置

令数据池为\(D=\{(x_i, \mathcal{O}_i, y_i, r_i)\}_{i=1}^{N}\),其中\(x_i\)是医学问题(及上下文,如存在),\(\mathcal{O}_i\)是其选项集,\(y_i\)是已知的正确选项,\(r_i\)是候选理由。我们首先在所有\((x_i, y_i)\)对上训练一个仅基于答案的模型\(f_{\theta_0}\)。此阶段不使用理由。

每个理由有令牌成本\(c_i\)。选择器对候选理由排序并选择子集\(S \subseteq \{1, \ldots, N\}\),使得\(\sum_{i \in S} c_i \leq B\)。只有\(\{r_i : i \in S\}\)被解锁用于理由训练分支。在我们的离线实验中,\(r_i\)对理由感知的评分函数可见;因此,该设置模拟的是从现有或低成本生成的候选解释中选择用于验证/训练,而非在理由生成之前进行选择。这一范围区分对我们的主张至关重要。

### 3.2基于理由局部的扰动

对于候选理由\(i\),我们将理由和后缀“Final Answer:”附加到问题和选项后。令\(a_{ij}\)为在答案位置处选项\(j\)的对数几率。干净的正确答案与干扰项的差值为

\[
m_i = a_{iy_i} - \max_{j \neq y_i} a_{ij}.
\]

(1)

在Transformer层\(\ell\),令\(H_i^{(\ell)} \in \mathbb{R}^{T \times d}\)为隐状态,\(M_{i,R} \in \{0,1\}^{T \times 1}\)仅遮罩理由令牌。我们进行扰动:

\[
\widetilde{H}_i^{(\ell,k)} = H_i^{(\ell)} + \alpha \, \operatorname{RMS}\left(H_{i,R}^{(\ell)}\right) \left(M_{i,R} \odot Z_i^{(\ell,k)}\right), \quad Z_i^{(\ell,k)} \sim \mathcal{N}(0,I),
\]

(2)

其中\(\operatorname{RMS}(H_{i,R}^{(\ell)})\)在遮罩的令牌和隐维度上计算。相对缩放避免了在激活幅度不同的层之间比较固定的绝对噪声水平。将噪声限制在理由位置,是为了探究答案边界对该候选解释本身的依赖程度,而非问题整体的依赖程度。

令\(\widetilde{m}_i^{(\ell,k)}\)为扰动后的差值,\(d_i^{(\ell,k)} = m_i - \widetilde{m}_i^{(\ell,k)}\)。对于层集合\(\mathcal{L}\)和每层\(K\)次扰动,标准评分为

\[
s_i^{\text{RMS-RSP}} = \sqrt{\frac{1}{|\mathcal{L}|K} \sum_{\ell \in \mathcal{L}} \sum_{k=1}^{K} \left(d_i^{(\ell,k)}\right)^2}.
\]

(3)

我们优先选择分数较高的项,并在成本超过剩余令牌预算时贪婪地跳过。RMS幅值不区分方向:正确答案差值的减小或增加都表明边界对理由表示局部敏感。我们的符号RSP消融实验则使用带符号的平均下降值\(\frac{1}{|\mathcal{L}|K} \sum_{\ell,k} d_i^{(\ell,k)}\)。

### 3.3下游理由训练

从仅基于答案的适配器开始,每个被选中的项目贡献一条答案重播记录和一条以正确答案结尾的理由生成记录。我们另外为每个被选中项目从未选中数据池中采样一个仅基于答案的重播项。这种配对设计降低了选择器仅通过改变答案监督量而获胜的可能性。在推理时,模型直接对答案字母进行评分,不生成理由。

## 4实验设计

### 4.1数据集与划分

表1(https://arxiv.org/html/2609.09684#S4.T1)总结了固定的划分方案。我们使用MedExpQA的英文子集和AfriMed-QA的专家多选部分。移除了多答案的AfriMed-QA行。MedExQA和PubMedQA在精确去重后使用确定性派生划分;其他数据集在可用时保留了官方测试集。没有测试项目用于选择令牌预算。MedMCQA测试集在早期探索性工作中已被评估,因此其结果是符合协议的,而非全新的验证。

表1:数据集与固定协议。“RSPnn”是在开发集锁定的令牌预算下,标准RMS-RSP选择的理由数量。
### 4.2模型、获取与训练

所有运行均使用带LoRA适配器(Hu等,2022 (https://arxiv.org/html/2609.09684#bib.bib6))的MedGemma-4B-IT(Sellergren等,2025 (https://arxiv.org/html/2609.09684#bib.bib5))。仅基于答案的适配器在所有数据池答案上训练一个周期(\(r=16\),LoRA \(\alpha=32\),学习率\(2 \times 10^{-4}\))。每个理由分支从该适配器开始,以\(10^{-4}\)的学习率训练两个周期,序列长度1024,批大小1,梯度累积8,并进行一对一的未选中答案重播。我们使用训练种子13、23和37。

对于RMS-RSP,\(\mathcal{L} = \{-2, -4, -8\}\),\(K=4\),扰动尺度\(\alpha = 0.10\)。候选令牌预算为256、512和1,024。对于每个数据集,开发数据通过最大化RMS-RSP准确率减去该预算下最强的非RSP选择器准确率来选择一个共享预算,若出现平局则偏向更少的令牌。然后,我们在固定预算下对所有方法进行一次评估。由于此规则以RMS-RSP为中心,我们还报告了所有预算上的令牌-AUBC,以防某个有利的单预算影响结论。

随机选择使用三个获取种子与三个训练种子交叉(每个预算九次运行)。确定性选择器使用三个训练种子。相同的被选集在所有下游种子中使用;随机获取独立变化。

作为高资源参考,我们还从相同的仅基于答案适配器出发,在所有数据池理由上训练相同的两个周期。此全监督条件消耗29,399至129,935个已评分的令牌(取决于数据集),且没有未选中的重播池。它既未匹配预算分支的令牌量也未匹配更新次数,因此作为非预算参考报告,而非竞争性选择器。

### 4.3基线方法

我们与答案熵、负的前两名答案差值、理由长度和随机选择进行比较。五个近期选择器被适配到共享的候选理由池:

- • **Complexity-aware FT**:按答案位置词汇熵排序(Goncharov等,2026 (https://arxiv.org/html/2609.09684#bib.bib12))。
- • **RSR**:使用令牌排名除以意外度,符号取反使得分数越高越优先选择(Yang等,2026 (https://arxiv.org/html/2609.09684#bib.bib13))。
- • **LALP**:对来自问题和前25%步骤的平均步骤似然进行评分(Just等,2026 (https://arxiv.org/html/2609.09684#bib.bib14))。
- • **ASLEC-DROP**:在丢弃每个步骤的第一个令牌后,对理由令牌似然求平均(Wang等,2026 (https://arxiv.org/html/2609.09684#bib.bib15))。
- • **TEMP**:结合经过校准的随机参数扰动下的损失和沿小理由-LoRA方向外推的检查点(Jin等,2026 (https://arxiv.org/html/2609.09684#bib.bib16))。

相似文章

选择性问答中的渐近风险校准

arXiv cs.CL

本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。