TriageRA-CCF:面向自适应秩预算的源端临床置信度与覆盖信号(用于医学大语言模型)
摘要
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
arXiv:2606.29375v1 公告类型:新论文
摘要:医学大语言模型通常以固定的低秩预算进行适配,而医学问题在置信度、临床覆盖范围和跨领域难度上存在显著差异。我们研究面向参数高效医学问答的自适应秩预算:针对每个问题,适配器决定激活LoRA秩通道的小、中、大子集。核心挑战在于,朴素的自适应预算路由器可能崩溃至不稳定选择,或在不改善偏移基准的情况下消耗容量。我们提出TriageRA-CCF,一种用于自适应秩预算LoRA的源端教师模型。它结合了仅从源训练数据计算的三个信号:基座模型答案置信度、元数据单元临床覆盖度以及反事实接近失误代理。这些信号监督一个在活跃秩{2,4,8}上的直通预算路由器,并结合预算成本、熵和秩平衡正则化。在匹配的CMB源训练协议下,TriageRA-CCF在Qwen3-8B和Llama3.1-8B上均取得了LoRA、DoRA和MoELoRA基线中最佳的平均准确率。增益适度且在基准间非均匀:在Qwen3-8B上比最强外部基线平均高+0.21个百分点,在Llama3.1-8B上高+0.16个百分点。组件消融实验表明,置信度、覆盖度和反事实信号均提供了有用的预算监督,但它们的组合并非在所有主干的每个维度上都单调最优。
查看缓存全文
缓存时间: 2026/06/30 05:30
# TriageRA-CCF:医学大语言模型中面向自适应秩预算的源端临床置信度与覆盖信号
来源:https://arxiv.org/html/2606.29375
11institutetext:四川大学计算机学院,成都,中国
11email:jishucan@stu\.scu\.edu\.cn, guohongliang@scu\.edu\.cn22institutetext:元涌现实验室
22email:huangyining1987@gmail\.com###### 摘要
医学大语言模型通常采用固定的低秩预算进行适配,尽管医学问题在置信度、临床覆盖范围和跨领域难度上存在显著差异。我们研究面向参数高效医学问答的自适应秩预算:对于每个问题,适配器决定激活LoRA秩通道的小、中或大子集。核心挑战在于,朴素的适应预算路由器可能崩溃为不稳定的选择,或在迁移基准上投入容量却无提升。我们提出TriageRA-CCF,一种用于自适应秩预算LoRA的源端教师模型。它结合仅从源训练数据计算的三类信号:基模型答案置信度、元数据细胞临床覆盖度以及一个反事实接近失误代理。这些信号监督基于直通估计的预算路由器(其激活秩范围为\{2,4,8\}),并辅以预算成本、熵和秩平衡正则化。在匹配的CMB源训练协议下,TriageRA-CCF在Qwen3-8B和Llama3.1-8B上均取得了LoRA、DoRA和MoELoRA基线中的最佳平均准确率。提升幅度温和且非均匀分布:在Qwen3-8B上相较于最强外部基线平均高出0.21个百分点,在Llama3.1-8B上高出0.16个百分点。组件消融实验表明,置信度、覆盖度和反事实信号均能提供有效的预算监督,但在每个基座模型上它们的组合并非单调最优。
## 1引言
医学多项选择问答已成为大语言模型临床知识的一种实用压力测试。诸如CMB、CMExam、MedQA和MedMCQA等基准涵盖异构的医学专科、职业和推理操作[21 (https://arxiv.org/html/2606.29375#bib.bib1),11 (https://arxiv.org/html/2606.29375#bib.bib2),7 (https://arxiv.org/html/2606.29375#bib.bib3),15 (https://arxiv.org/html/2606.29375#bib.bib4)],而医学LLM研究表明,强大的通用模型在临床使用前仍需仔细适配和验证[17 (https://arxiv.org/html/2606.29375#bib.bib6),18 (https://arxiv.org/html/2606.29375#bib.bib7)]。一种常见的适配方案是微调固定秩的LoRA或LoRA专家混合体。这简单高效,但它将每个问题视为需要相同数量的更新容量。
这种固定容量假设与医学考试数据的实际情况匹配不佳。有些问题是直接回忆式题目,其答案选项在基模型上已有较大边际;激进的适配器更新几乎无益,甚至可能扰乱正确回答。其他问题则存在歧义、在源训练分布中代表性不足,或接近基模型可解状态。这些情况可能需要更多适配器容量。换言之,相关的问题在于应为每个样本激活多少低秩适配容量,而非假设所有医学问题采用单一容量水平。
因此,我们研究在单一共享LoRA基内的自适应秩预算。模型学习 \(A\) 和 \(B\),并在每个输入上对 \(B \operatorname{diag}(m(x))A\) 中的秩通道进行门控,而非学习一整套适配器。独立的预算路由器选择 \(k(x) \in \{2,4,8\}\) 个活跃秩通道。动机直接:简单且置信度高的样本应使用较小预算,而不确定、覆盖不足或可能可修复的样本应激活更多秩容量。然而,仅通过答案损失训练的预算路由器难以稳定。它可能学到伪相关的预算选择、过度使用大预算,或在迁移基准上无法带来提升。
我们提出TriageRA-CCF,其中CCF表示**置信度**、**临床覆盖度**和**反事实代理**。教师模型完全基于源训练样本构建。置信度利用基模型选项评分:大边际和低熵表明低预算样本,而小边际和高熵暗示更高预算。临床覆盖度统计粗粒度的源元数据细胞,例如专业或职业与弱临床操作标签的交叉组合,其动机在于罕见临床操作的代表性不足。反事实代理标记基模型的接近失误:当基答案错误但正确选项仍名列前茅时,这些样本额外适配容量可能有所帮助。图1 (https://arxiv.org/html/2606.29375#S1.F1) 总结了设计。
查看图注 图 1: TriageRA-CCF 从基模型置信度、反事实接近失误信号和临床覆盖度构建源端预算监督。学习得到的预算路由器在单个共享LoRA基内激活一小组、中组或大组秩通道。我们的贡献如下:
- • 我们将医学PEFT形式化为输入条件化的活跃秩预算,其中每个问题选择使用多少LoRA秩容量。
- • 我们引入一个源端CCF预算教师,利用答案置信度、临床元数据覆盖度和接近失误反事实代理,无需目标基准标签。
- • 我们通过直通估计的自适应秩预算LoRA实现该方法,并辅以预算成本、熵和秩平衡正则化。
- • 我们在统一的CMB源协议下对Qwen3-8B和Llama3.1-8B进行评估,显示在比较的外部PEFT基线中具有最佳平均准确率,同时报告非均匀的逐基准行为和非单调的组件消融结果。
表1 (https://arxiv.org/html/2606.29375#S1.T1) 总结了设计选择及每个组件的动机。包含该表是因为该方法有意保持保守:它不添加大型外部验证器或新的专家库,而是利用简单的源端证据使自适应预算策略减少随意性。
表 1: TriageRA-CCF 中的设计动机。
## 2 相关工作
#### 医学LLM评估。
医学QA基准测试事实知识和临床推理。PubMedQA专注于生物医学研究问答[8 (https://arxiv.org/html/2606.29375#bib.bib5)];MedQA和MedMCQA收集英语考试形式的多项选择题[7 (https://arxiv.org/html/2606.29375#bib.bib3),15 (https://arxiv.org/html/2606.29375#bib.bib4)];CMB和CMExam提供了跨越专业和职业的广泛中文医学考试[21 (https://arxiv.org/html/2606.29375#bib.bib1),11 (https://arxiv.org/html/2606.29375#bib.bib2)]。大型医学LLM研究如Med-PaLM和Med-PaLM 2报告了显著进展,但也强调了校准、不确定性和安全敏感性评估[17 (https://arxiv.org/html/2606.29375#bib.bib6),18 (https://arxiv.org/html/2606.29375#bib.bib7)]。我们的工作并非提出新基准;而是探究医学适配器是否应在所有基准项目上花费相同的低秩容量。
#### 参数高效适配。
LoRA冻结基模型并学习低秩更新矩阵[5 (https://arxiv.org/html/2606.29375#bib.bib10)];QLoRA使其适用于量化LLM微调[1 (https://arxiv.org/html/2606.29375#bib.bib11)];DoRA分解权重幅度和方向以增强低秩适配[13 (https://arxiv.org/html/2606.29375#bib.bib12)]。近期系统进一步适配Qwen和Llama系列基座[23 (https://arxiv.org/html/2606.29375#bib.bib8),3 (https://arxiv.org/html/2606.29375#bib.bib9)]。我们在相同源数据和训练长度下与LoRA和DoRA基线进行比较。与这些固定秩方法不同,TriageRA-CCF在每个问题上改变活跃秩预算,同时保留单个共享适配器基。
#### 自适应秩分配。
AdaLoRA根据LoRA组件的重要性估计分配参数预算[25 (https://arxiv.org/html/2606.29375#bib.bib13)]。DyLoRA训练一个秩范围,无需为每个秩重新训练[19 (https://arxiv.org/html/2606.29375#bib.bib14)],而IncreLoRA跨模块递增分配参数[24 (https://arxiv.org/html/2606.29375#bib.bib15)]。这些方法主要解决跨权重、模块或部署设置的秩分配问题。我们的关注点是互补的:秩预算取决于当前医学问题,并由源端临床不确定性信号监督。
#### LoRA专家的混合与路由。
稀疏混合专家模型将样本或token路由到专家子集[16 (https://arxiv.org/html/2606.29375#bib.bib22),2 (https://arxiv.org/html/2606.29375#bib.bib23)]。基于LoRA的专家混合体,包括MoELoRA、MoLE、MixLoRA和MING-MOE,将PEFT与专家路由结合[14 (https://arxiv.org/html/2606.29375#bib.bib16),22 (https://arxiv.org/html/2606.29375#bib.bib20),9 (https://arxiv.org/html/2606.29375#bib.bib18),10 (https://arxiv.org/html/2606.29375#bib.bib19)]。医学MOE-LoRA变体使用任务驱动的专家门控用于多任务医学应用[12 (https://arxiv.org/html/2606.29375#bib.bib17)];LoRAHub动态组合LoRA模块库[6 (https://arxiv.org/html/2606.29375#bib.bib21)]。TriageRA-CCF在两方面不同。首先,它不训练或选择一整组LoRA专家;而是在一个适配器内改变活跃秩通道。其次,其监督不是任务ID或专家标签,而是源端对输入应获得多少秩容量的估计。
#### 校准与不确定性。
校准工作表明,神经网络的置信度通常与正确性不一致[4 (https://arxiv.org/html/2606.29375#bib.bib24)],而测试时间适应方法可以利用熵或未标记统计量调整模型[20 (https://arxiv.org/html/2606.29375#bib.bib25)]。我们仅将置信度作为源端教师信号之一,而非部署时的保证。因此,预算教师特意与临床覆盖度和接近失误结构结合,并通过预算成本避免在所有位置都使用最大容量。
## 3 方法
### 3.1 问题设定
设 \(x\) 为源训练集中的医学多项选择题,包含选项和答案 \(y\)。一个冻结的基LLM配合可训练的适配器参数通过监督微调预测答案。标准LoRA使用固定低秩更新:
\[
W(x)h = W_0 h + \frac{\alpha}{r} B A h,
\qquad (1)
\]
其中 \(W_0\) 冻结,\(A, B\) 可训练。我们改用自适应秩预算更新:
\[
W(x)h = W_0 h + \frac{\alpha}{r} B \operatorname{diag}(m(x)) A h,
\qquad (2)
\]
其中 \(m(x)\) 是稀疏非负秩掩码。本文的贡献在于确定每个输入活跃条目数的源监督预算分支。
### 3.2 秩预算适配器
对于每个LoRA目标模块,从问题表示计算秩对数:
\[
s(x) = f_{\mathrm{rank}}(h_x),
\qquad (3)
\]
其中 \(h_x\) 是池化后的隐藏问题表示。单个秩通道被视为潜在容量单元。临床元数据出现在下面描述的源端覆盖教师中。
设 \(p_i(x) = \operatorname{softmax}(s(x))_i\) 覆盖 \(r\) 个秩通道。若预算分支选择 \(k\),前向传播保留前 \(k\) 个秩概率并重新缩放其质量:
\[
m_i^{(k)}(x) =
\begin{cases}
p_i(x) \cdot \tau_k(x), & i \in \operatorname{TopK}(p(x), k),\\
0, & \text{否则},
\end{cases}
\qquad (4)
\]
其中 \(\tau_k(x)\) 归一化所选质量,使得不同预算下的更新幅度可比。秩平衡惩罚阻止所有样本依赖相同秩通道,熵惩罚使softmax后的秩分布更加尖锐。
### 3.3 自适应预算路由器
预算路由器选择三个活跃秩预算 \(\mathcal{K} = \{2,4,8\}\) 之一。我们使用较小的离散集,因为训练预算短且策略易于审计:秩2是保守更新,秩4是中等操作点,秩8允许更多容量,同时仅激活存储的秩16基的一半。其对数从相同的问题表示计算:
\[
b(x) = b_0 + f_{\mathrm{budget}}(h_x).
\qquad (5)
\]
预算概率为 \(q(x) = \operatorname{softmax}(b(x)/T_b)\)。训练期间,所选预算为 \(q(x)\) 的直通argmax,而梯度通过软概率传播:
\[
\tilde{q}(x) = \operatorname{onehot}(\arg\max q(x)) - \operatorname{sg}(q(x)) + q(x).
\qquad (6)
\]
最终门控是候选前 \(k\) 掩码的概率加权组合:
\[
m(x) = \sum_{j=1}^{|\mathcal{K}|} \tilde{q}_j(x) m^{(k_j)}(x).
\qquad (7)
\]
成本项惩罚期望活跃预算:
\[
\mathcal{L}_{\mathrm{cost}} = \mathbb{E}_x\left[ \frac{\sum_j q_j(x) k_j}{\max(\mathcal{K})} \right],
\qquad (8)
\]
这防止始终选择最大秩预算的退化策略。
### 3.4 源端CCF预算教师
教师在适配器训练前构建,仅使用源训练样本。对于每个问题,冻结的基模型通过选项字母的下一token概率对答案选项进行评分。我们还推导出弱源元数据:可用的粗粒度专业或职业标签 \(r_x\),以及通过确定性关键词规则得到的临床操作标签 \(o_x\)。这些标签仅用于估计源覆盖度。我们推导出:
- • **置信度**:top-1/top-2边际、正确选项概率和归一化选项熵。高置信度促使低预算;低边际或高熵促使更高预算。
- • **反事实代理**:若基预测错误但正确选项排名靠前,则标记该样本为接近失误。动机在于额外适配容量更可能修复接近失误而非任意错误答案。
- • **临床覆盖度**:统计每个元数据细胞 \((r_x, o_x)\) 中的源样本数。稀有细胞至少获得中等预算先验,因为覆盖不足的临床操作更可能需要额外适配容量。
这些信号产生教师类别 \(z(x) \in \{0,1,2\}\),对应活跃秩 \(2,4,8\),以及非负权重 \(w(x)\)。形式上,当观察到接近失误、强不确定性或高熵时,分配高预算标签;中等不确定性或罕见临床元数据细胞时分配中等预算标签;否则样本标记为低预算。这条规则故意保持简单:目标不是学习目标基准预言机,而是为预算路由器提供源端归纳偏差以稳定训练。
源端限制很重要。如果使用目标基准标签来标记高预算样本,预算路由器可能成为隐藏的目标域选择器,而非可部署的适应方法。因此,我们允许教师使用源答案,因为监督相似文章
面向跨基准医学问答的临床结构化秩门控LoRA
本文提出BiRG-LoRA,一种用于医学问答的秩门控LoRA方法,利用临床结构化先验选择稀疏秩子集,在四个基准上达到69.31%的宏平均准确率,同时使用的参数少于混合专家方法。
RASC+: 面向临床值集编制的检索约束型大语言模型裁决方法
本文介绍了RASC+,一种用于临床值集编制的检索约束型大语言模型裁决方法,其通过基于Qwen3的检索和盲目裁决,提升了候选集召回率和选择精度,显著优于RASC基线中的直接生成方法。
弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
选择性问答中的渐近风险校准
本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。
Mental-R1:对齐LLM推理用于心理健康评估
提出认知相对策略优化(CRPO),一种用于对齐大语言模型在心理健康评估中推理的强化学习框架,在加权F1分数上比现有基线平均提高10.4个百分点。